9月16日,ARC Prize 创始人公布了一件事:OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 的半私有测试集上拿到 99.9%。分数高到直接把这份考卷提前作废——主办方随即宣布重做下一代评测。
99.9%是个什么概念
ARC-AGI 一直被称为"大模型照妖镜"。它考的不是知识,是面对从没见过的图形规律,能不能当场归纳出规则。人类做起来轻松,模型长期吃力。
这一次的对照很刺眼:
- GPT-6 Astra:99.9%
- Claude Opus 5:30.2%
- 更早一代模型:7.8%
同一份卷子,第一名和第二名差了近70个百分点。不是大家都进步了,是有一家跑到了另一个量级。
考卷自己做不下去了
ARC Prize 创始人的反应很务实:承认基准已饱和,并公布下一代蓝图——ARC-AGI-4 聚焦"更长周期的持续学习",ARC-AGI-5 则完全围绕"开放式发明"出题。
换句话说,考"能不能做对一道给好的题"已经没意义了,接下来要考的是"能不能在没有题目的地方自己找出题"。
评测体系的升级,本身就是模型能力跃迁的副产品。
发布周:不止一个模型在动
这几天 OpenAI 的动作密度异常。产品负责人称本周发布数量将达 DevDay 级别,Altman 也预告有大版本。已有用户反馈,用 GPT-5.6 Sol 时后台被路由到了 GPT-6 Sol,"速度很快"。
同时官方宣布:GPT-5.5 系列将于 10 月 14 日在全平台下线。一款发布才半年、曾帮 OpenAI 稳住 Codex 用户盘的模型,就这样退场。
模型开始有了"货架期",而且越来越短。
嘴上喊刹车,手里在换发动机
有意思的是时间点。就在几天前,Anthropic 的 Dario 在长文里呼吁放慢前沿迭代,OpenAI 的 Altman 公开声援。而现在,两家被发现在同一周各自灰度测试新一代模型——OpenAI 测 GPT-6 Sol,Anthropic 测 Opus 5.2。
Dario 的核心论据是:前沿技术向实体产业落地兑现价值的渗透率只有 5% 到 10%,就算模型不再突破,现有技术也有大量红利可挖。
这个判断本身没错,但它解释不了一件事:如果现有技术真的够用,为什么还要这么急地换代?
对普通人的三个提醒
1. 别把工作流绑死在单一模型上。半年前还是主力的 GPT-5.5 要下线了,任何"我用惯了这个"都可能在下个季度失效。
2. 评测分数会越来越难懂。基准饱和之后,"第一名"的含义变了——它不再代表真实可用性,只代表在某个特定尺子上的领先。
3. 看任务闭环,不看参数。这轮竞争的落点已经从"模型更聪明"转向"能不能把一件事从头做完"。
评分表可以重做,但用户不会重做。他们只会记得,谁真的把活干完了。