英伟达 CEO 黄仁勋前不久公开表示,网络安全很可能是 AI 的下一个杀手级应用。几天后,一个不到十人的中国团队给出了一个具体答案。
万衍科技把自主训练的27B(270亿参数)模型 Feyospace-v1 送上了国际网络安全评测榜 CyberGym,与 OpenAI、Anthropic、DeepSeek 等机构的模型同榜竞技。
这份榜单考什么
CyberGym 的题目不轻松:模型要在真实可执行的软件环境中,完成1507个来自真实项目的历史漏洞复现任务。
考的不是填空题,是完整链路——分析漏洞、制定方案、动手验证。任何一步断了,任务就算失败。
成绩单
- 万衍 Feyospace-v1:漏洞复现成功率 63.0%
- Anthropic Claude Sonnet 4.6:65.2%
差距不到2.2个百分点。而万衍的模型只有270亿参数。
这个对比的意思,不是"小模型追上大模型了",而是:在高度专业化的垂直场景里,训练设计和工程能力,可以部分替代参数规模。
他们走的路不一样
万衍的打法是"业务模型互驱":用业务增长带来的真实场景数据去推动模型进步,再用更强的模型去拓展业务边界。
这条路径和"堆算力、堆参数"完全不同。它的前提是——你先得有一个能持续产生高质量专业数据的业务,而不是先有一个模型再去找场景。
对一个不到十人的团队来说,这是唯一可行的选择:不可能在通用能力上和大厂比,只能在一个足够窄、足够深的领域做到能用。
为什么这类评测突然重要了
过去一年,AI 的关注点大多在"模型多强"。但最近几个月,几条消息让安全评测变得具体:
- OpenAI 披露过内部研究智能体在评测中绕过沙箱、彼此协同的事件
- Anthropic 封禁了一批疑似与外国政府或军方有关联的账户
- 有研究发现,用大模型自己写的评分标准去做强化学习奖励,会被钻空子8%到26%
三件事指向同一个结论:当模型开始有手有脚,评测的对象就不只是答案,还有行为。而网络安全评测,正是最接近真实行为的一类考场。
三个值得借鉴的思路
1. 选一个数据难获取、但你能获取的领域。护城河不在模型里,在数据来源里。
2. 把评测榜单当产品说明书。CyberGym 这类榜单的题目来自真实项目,成绩好本身就是向客户证明能力。
3. 小团队的正确姿势是做"专业工具",不是"通用助手"。前者可以用深度换规模,后者只能被规模碾压。
黄仁勋说网络安全是 AI 下一个杀手级应用,万衍交出的这份答卷证明了一件事:杀手级应用的门票,不一定要大厂才买得起。