---
title: "音视频调用便宜了98%之后，多模态还差最后一公里？"
date: 2026-09-19
category: AI大模型
site: 脑机网
canonical: https://www.logic.wang/a/njw-7fdfb3
language: zh-CN
---

# 音视频调用便宜了98%之后，多模态还差最后一公里？

> 9月18日，阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash。最抓眼球的数字不在性能榜上，而在价目表上：每小时音频输入的价格降幅超过98%，音视频输入的降幅超过93%。

9月18日，阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash。最抓眼球的数字不在性能榜上，而在价目表上：每小时音频输入的价格降幅超过98%，音视频输入的降幅超过93%。

放在半年前，这个价格几乎是不可想象的。多模态之所以一直"叫好不叫座"，很大一部分原因就是账单——一段半小时的会议录音转写加总结，成本可能比请人做还贵。现在这道门槛被踹掉了一大半。

**能听、能看、还能自己干活**

参数层面的变化同样不小。这个模型支持文本、图像、音频、视频四种输入，上下文窗口拉到 1M，官方给出的定位是推动全模态模型从"理解内容"走向"规划任务、调用工具并完成创作"。

在累计 30 项评测中，它相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%。音视频 Agent、Coding 与长程任务在 WildClawBench-MM 上提升 36.5 分，在 AgenticVBench 上提升 22.3 分，UniClawBench 取得 69.6 分。音频能力整体超过 Gemini 3.8 Flash，音视频能力接近该模型。

这些分数翻译过来是什么意思？就是长音视频理解、会议纪要生成与任务执行、音乐视频创作、短剧翻译、长电影解说这类端到端工作流，开始有了跑通的经济性。

**一个有意思的实验：让模型去优化模型**

更值得琢磨的是阿里云披露的一个内部实验——"模型优化模型"。团队让 Qwen3.8-Omni-Flash 反过来去优化一个更小的模型，结果在 12 小时内，把 Qwen2.5-Omni-3B 的四川话识别字符错误率从 25.79% 压到了 15.30%。

12 小时，方言识别错误率下降超过十个百分点。这个数字的意义不在于四川话本身，而在于它验证了一条路径：大模型的价值不再只是"被调用"，还可以是"去训练"。

过去我们习惯把大模型当成终点——用户提问，模型作答。但如果大模型能成为生产小模型的工具，那么整个模型供给的曲线就会被改写。小模型部署成本低、端侧可跑，短板一直是能力不够；现在补齐能力的方式，从"堆人力标注"变成了"让大模型去教"。

阿里同期开源了 Qwen-MM-Plugins 与 Qwen-Live Harness，分别面向长程工作流与实时交互。开源这两个东西，摆明了是想让别人也来走这条路。

**降价背后是另一场竞赛**

回到价格本身。98% 的降幅不是慈善，是竞争结构变化的结果。当全模态能力不再是稀缺品，定价权就从"谁有"转向"谁便宜、谁稳定、谁接得上业务"。

对开发者来说这是好事。对行业来说，这意味着多模态应用的爆发点可能不在模型侧，而在应用侧——谁先把成本降下来的能力变成产品，谁就先跑出来。

但也要留一份清醒。价格下降会放大调用量，调用量放大又会反过来考验推理集群的稳定性和成本控制能力。便宜不等于可持续，历史上每一次大幅降价最后都会有一次压力测试。

技术往前走了一步，商业化也往前走了一步。最后一公里，其实从来都不在模型里，而在有人愿意为它付钱的那些场景里。

---

来源：脑机网（https://www.logic.wang/）｜原文：https://www.logic.wang/a/njw-7fdfb3
本内容仅供参考，不构成投资建议。
