9月17日,小米 MiMo 大模型团队负责人罗福莉公开分享了模型最新进展,并直接把 MiMo-V2.6 的实时强化学习训练页面直播了出来。
页面上最刺眼的是成本:截至当天下午,Pro 与 Flash 两个版本累计训练成本超过 135 万美元,折合每小时约 3.1 万美元,也就是每小时烧掉超过 20 万元人民币。
开源的是账单,不只是模型
直播训练过程这件事本身并不新鲜,新鲜的是把账单一起摊开。
大模型行业的成本数据一向是黑箱。外界能看到的只有最终发布时的跑分,至于为了这几个点花了多少算力、试错了多少轮,几乎没有团队愿意公开。原因不难理解:成本是议价的筹码,也是被质疑的把柄。
罗福莉的做法反了过来,团队还确认将在近几周内逐步开源相关技术细节。
这种透明度有实际价值。强化学习阶段的成本曲线,是判断一家公司"能不能持续投入"最直接的证据——每小时 3 万美元的消耗,意味着这不是一次可以靠小团队情怀撑下来的试验。
技术上到底做了什么
从披露的信息看,这一轮强化学习在三个方向做了扩展:计算资源、环境测试框架、评估计算。单个训练 step 扩大到约 2B tokens,采用完全异步训练,混合了视觉、代码、通用与聊天等多任务环境。
更值得留意的是"智能体式组内贡献归因"——结合测试用例与评分细则给予奖励,而不是简单地给最终结果打分。这解决的是强化学习里最麻烦的奖励稀疏问题:当一个任务要几十步才能完成,只奖励最终结果,模型很难知道到底哪一步做对了。
Pro 版在 DeepSWE v1.1 上拿到了 63.72 分。
为什么这个人值得关注
罗福莉此前在 DeepSeek 的经历让她进入公众视野,这次是她加盟小米后的首度公开直播。
把视角拉远一点,国内大模型团队的技术负责人正在形成一个共同特征:越来越愿意把过程公开。有人在直播训练,有人在公开成本,有人在开源数据生产管线。
这背后是竞争阶段的切换。当模型能力的差距缩小到几个百分点,可信度就成了稀缺资源——用户和企业客户要判断的不再是"谁更强",而是"谁的说法可以核实"。
公开账单当然也是一种自信:敢让人看花了多少钱,通常意味着敢让人看效果。但更实际的意义在于,它给行业提供了一把尺子。后来者要评估自己能不能进场,不再只能靠猜。
顺带一提,每小时 20 万元人民币的消耗,也让人重新理解"开源"这两个字的重量。开源的不只是权重,还有一条可以被检验的投入曲线——愿意把这两样东西同时交出来,本身就是一种稀缺的姿态。