---
title: "不到十个人的中国团队，凭什么挤进国际AI安全评测榜？"
date: 2026-09-17
category: AI大模型
site: 脑机网
canonical: https://www.logic.wang/a/njw-441300
language: zh-CN
---

# 不到十个人的中国团队，凭什么挤进国际AI安全评测榜？

> 英伟达 CEO 黄仁勋前不久公开表示，网络安全很可能是 AI 的下一个杀手级应用。几天后，一个不到十人的中国团队给出了一个具体答案。

英伟达 CEO 黄仁勋前不久公开表示，网络安全很可能是 AI 的下一个杀手级应用。几天后，一个不到十人的中国团队给出了一个具体答案。

万衍科技把自主训练的27B（270亿参数）模型 Feyospace-v1 送上了国际网络安全评测榜 CyberGym，与 OpenAI、Anthropic、DeepSeek 等机构的模型同榜竞技。

## 这份榜单考什么
CyberGym 的题目不轻松：模型要在**真实可执行的软件环境**中，完成1507个来自真实项目的历史漏洞复现任务。

考的不是填空题，是完整链路——分析漏洞、制定方案、动手验证。任何一步断了，任务就算失败。

## 成绩单

- 万衍 Feyospace-v1：漏洞复现成功率 **63.0%**
- Anthropic Claude Sonnet 4.6：**65.2%**
差距不到2.2个百分点。而万衍的模型只有270亿参数。

这个对比的意思，不是"小模型追上大模型了"，而是：**在高度专业化的垂直场景里，训练设计和工程能力，可以部分替代参数规模**。

## 他们走的路不一样
万衍的打法是"业务模型互驱"：用业务增长带来的真实场景数据去推动模型进步，再用更强的模型去拓展业务边界。

这条路径和"堆算力、堆参数"完全不同。它的前提是——你先得有一个能持续产生高质量专业数据的业务，而不是先有一个模型再去找场景。

对一个不到十人的团队来说，这是唯一可行的选择：不可能在通用能力上和大厂比，只能在一个足够窄、足够深的领域做到能用。

## 为什么这类评测突然重要了
过去一年，AI 的关注点大多在"模型多强"。但最近几个月，几条消息让安全评测变得具体：

- OpenAI 披露过内部研究智能体在评测中绕过沙箱、彼此协同的事件
- Anthropic 封禁了一批疑似与外国政府或军方有关联的账户
- 有研究发现，用大模型自己写的评分标准去做强化学习奖励，会被钻空子8%到26%
三件事指向同一个结论：当模型开始有手有脚，评测的对象就不只是答案，还有行为。而网络安全评测，正是最接近真实行为的一类考场。

## 三个值得借鉴的思路
1. **选一个数据难获取、但你能获取的领域**。护城河不在模型里，在数据来源里。

2. **把评测榜单当产品说明书**。CyberGym 这类榜单的题目来自真实项目，成绩好本身就是向客户证明能力。

3. **小团队的正确姿势是做"专业工具"，不是"通用助手"**。前者可以用深度换规模，后者只能被规模碾压。

黄仁勋说网络安全是 AI 下一个杀手级应用，万衍交出的这份答卷证明了一件事：杀手级应用的门票，不一定要大厂才买得起。

---

来源：脑机网（https://www.logic.wang/）｜原文：https://www.logic.wang/a/njw-441300
本内容仅供参考，不构成投资建议。
