脑机网 脑机网LOGIC.WANG
ESC

AI同传把延迟压到2.3秒,以后开会还需要人工译员吗?

想象一场跨国视频会议:对方话说完,你的耳机里过了两秒才慢悠悠出译文。内容没错,但节奏全断了——你刚想接话,发现对面已经讲到下一段。

2026-09-20 · 1090 字 · 脑机网

想象一场跨国视频会议:对方话说完,你的耳机里过了两秒才慢悠悠出译文。内容没错,但节奏全断了——你刚想接话,发现对面已经讲到下一段。

同声传译这门生意,卖的从来不是"翻译得准",而是"几乎不占时间"。9月19日,阿里千问正式发布同声传译大模型 Qwen3.8-LiveTranslate,直接冲着这个"几乎"去的。

0.5秒,为什么值得专门发一场发布会

新模型的字均延迟(LAAL)从上代的 2.8 秒降到 2.3 秒。听起来只是个小数点后的数字,但对同传来说,这半秒决定了听感是"自然"还是"别扭"。

延迟来源不是翻译能力不够,而是流程太长:先听完一句、再识别文字、再翻译、再合成语音,四个环节排队走。字均延迟压缩,本质是把这条流水线拧成一股绳。

翻译出来的声音,还是你原本的声音

底座是 Hybrid MoE 的 Thinker–Talker 双模块设计,用 Interleave 架构把流式理解、文本输出和语音生成串成一条因果序列。

Thinker 负责"听懂"和"译出"——它把视频、音频、原文、译文编排进同一条序列,按时序交替排列、端到端产出。Talker 接过译文和源音频,把译文合成为保留原说话人音色的语音。

也就是说,对方在耳机里听到的,仍是你的音色在说外语。

在支持 60 种语言的基础上,这次补了三块让同传真正能落地的拼图:

  • 实时说话人分离:多人交替发言时,每句话归到对应的人头上,音色复刻更稳
  • 原文译文同帧同出:双语同屏显示,能边听边核对原文
  • 长上下文消歧:联系前文理解当下,人名、术语这类最容易翻错的地方精准度提升

据官方发布的信息,在覆盖 14 个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,翻译忠实度、流畅度、简洁度与说话人分离错误率四个维度均优于当前主流实时同传系统;公开 FLEURS 测试集的 70 个语言方向同样领先。

谁最先用上

不是国际会议,而是那些"请不起同传、又必须跨语言"的场景:

  • 出海企业的日常跨时区会议,以前靠会后纪要,现在可以当场对话
  • 跨境直播和客服,字幕和语音能同步产出,不必等后期
  • 线上课程与培训,讲师说中文,学员听母语,且保留讲师音色

模型 API 已在千问 AI 平台上线,尝鲜入口同步开放。

三个值得盯的观察点

1. 真实多人会议的表现:评测集是实验室口径,饭桌上三个人抢话才是真考卷

2. 术语与口音的边界:法律、医疗这类高精度场景,错一个词成本很高,敢不敢用取决于错误率

3. 成本曲线:同传过去是稀缺的人工服务,一旦按 token 计价,定价方式会重新定义这门生意

技术替代的从来不是"人",而是"人对时间的要求"。同传译员真正的护城河,正在从"听得快"转向"担得起责任"——这一层,模型还没接过去。

查看「AI大模型」更多内容 → · 返回首页