上周,一位做软件外包的朋友算了笔账:同样一段代码,换个贵模型,账单能差出七八倍。
他的结论很朴素——以前挑模型只看"谁更聪明",现在得先看"谁更划算"。
这个转变,正好撞上9月20日的一件事。
一个"只激活一小部分"的大模型
9月20日,阶跃星辰发布新一代旗舰基座模型 Step 5 Preview。
它的参数结构有点反直觉:总参数量600B(6000亿),但每处理一个Token,只激活约27B(270亿)。
打个比方,一座6000人的大厂,真正同时开工的只有一个27人的小组。需要什么工种就临时叫谁——这就是"稀疏混合专家(MoE)"架构的通俗版本。
配套的是100万Token的上下文窗口,原生支持文本和图片输入。
44分,全球开源前三
在全球权威评测 Artificial Analysis Intelligence Index 中,Step 5 Preview 取得44分,跻身全球开源模型前三。
更关键的是成本。官方称,该模型单任务成本约为 Claude Opus 5 的八分之一。
换句话说,同样一笔预算,它能干的活多出好几倍。
技术上,它没有走"加宽网络"的老路,而是选了"窄而深":共92层Transformer。官方称,团队针对训练稳定性做了专门优化。
为了压住百万级上下文的开销,它还引入了 Sparse GQA 与 Block-wise Token Merging,官方称把索引与Top-k选择环节的成本降到原来的八分之一。
不只跑分,还能连续干活
评测里还有几个更"硬"的细节。
在 Agents' Last Exam 的CLI子集ALE-CLI、金融投资研究评测FrontierFinance、跨领域深度研究评测DRACO上,它的成绩仅次于 GPT-6 Astra 或 Claude Opus 5,领先其他参评开源模型。
在自建的StepCodeBench(覆盖553个代码仓库、9类任务、33种编程语言)中,它在整体任务成功率和跨场景稳定性上表现突出。
长任务能力也做了实测:在24小时GPU Kernel优化任务中,它把MLA内核峰值性能提升到508 TFLOPS,超过 Claude Opus 5 的493 TFLOPS;在自动化后训练实验中,把一个小模型在AIME24上的准确率从53.3%提到60%。
应用场景上,它能完成ESP32开发板改造(连续执行超过3小时)、前端设计与3D资产生成、金融研究全流程等复杂任务。
为什么这件事值得普通人关注
过去两年,大模型的竞争逻辑一直是"堆算力换能力"。但当真要用它干活——写代码、做研究、跑金融分析——成本就成了天花板。
阶跃星辰的说法是:下一阶段的核心,是提高"计算转化为智能"的效率。
落到实操:模型计划10月15日开源权重。开源意味着大量中小公司、个人开发者不必再为大厂的API账单发愁。
普通人现在能做什么
1. 别急着为最贵的模型付费。同样的任务,先拿便宜模型试一遍,很多时候差别没你想象的大。
2. 学会用"每块钱换多少智能"来评估。不看榜单绝对值,看性价比。
3. 关注开源与国产芯片适配。不少国产模型已能在国产AI芯片集群上完成推理部署,这会进一步压低成本。
大模型的下一场比赛,不是谁更聪明,而是谁把一度电用得更值。