脑机网 脑机网LOGIC.WANG
ESC

音视频调用便宜了98%之后,多模态还差最后一公里?

9月18日,阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash。最抓眼球的数字不在性能榜上,而在价目表上:每小时音频输入的价格降幅超过98%,音视频输入的降幅超过93%。

2026-09-19 · 1205 字 · 脑机网

9月18日,阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash。最抓眼球的数字不在性能榜上,而在价目表上:每小时音频输入的价格降幅超过98%,音视频输入的降幅超过93%。

放在半年前,这个价格几乎是不可想象的。多模态之所以一直"叫好不叫座",很大一部分原因就是账单——一段半小时的会议录音转写加总结,成本可能比请人做还贵。现在这道门槛被踹掉了一大半。

能听、能看、还能自己干活

参数层面的变化同样不小。这个模型支持文本、图像、音频、视频四种输入,上下文窗口拉到 1M,官方给出的定位是推动全模态模型从"理解内容"走向"规划任务、调用工具并完成创作"。

在累计 30 项评测中,它相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%。音视频 Agent、Coding 与长程任务在 WildClawBench-MM 上提升 36.5 分,在 AgenticVBench 上提升 22.3 分,UniClawBench 取得 69.6 分。音频能力整体超过 Gemini 3.8 Flash,音视频能力接近该模型。

这些分数翻译过来是什么意思?就是长音视频理解、会议纪要生成与任务执行、音乐视频创作、短剧翻译、长电影解说这类端到端工作流,开始有了跑通的经济性。

一个有意思的实验:让模型去优化模型

更值得琢磨的是阿里云披露的一个内部实验——"模型优化模型"。团队让 Qwen3.8-Omni-Flash 反过来去优化一个更小的模型,结果在 12 小时内,把 Qwen2.5-Omni-3B 的四川话识别字符错误率从 25.79% 压到了 15.30%。

12 小时,方言识别错误率下降超过十个百分点。这个数字的意义不在于四川话本身,而在于它验证了一条路径:大模型的价值不再只是"被调用",还可以是"去训练"。

过去我们习惯把大模型当成终点——用户提问,模型作答。但如果大模型能成为生产小模型的工具,那么整个模型供给的曲线就会被改写。小模型部署成本低、端侧可跑,短板一直是能力不够;现在补齐能力的方式,从"堆人力标注"变成了"让大模型去教"。

阿里同期开源了 Qwen-MM-Plugins 与 Qwen-Live Harness,分别面向长程工作流与实时交互。开源这两个东西,摆明了是想让别人也来走这条路。

降价背后是另一场竞赛

回到价格本身。98% 的降幅不是慈善,是竞争结构变化的结果。当全模态能力不再是稀缺品,定价权就从"谁有"转向"谁便宜、谁稳定、谁接得上业务"。

对开发者来说这是好事。对行业来说,这意味着多模态应用的爆发点可能不在模型侧,而在应用侧——谁先把成本降下来的能力变成产品,谁就先跑出来。

但也要留一份清醒。价格下降会放大调用量,调用量放大又会反过来考验推理集群的稳定性和成本控制能力。便宜不等于可持续,历史上每一次大幅降价最后都会有一次压力测试。

技术往前走了一步,商业化也往前走了一步。最后一公里,其实从来都不在模型里,而在有人愿意为它付钱的那些场景里。

查看「AI大模型」更多内容 → · 返回首页