阿里千问 Qwen3.8-LiveTranslate 发布:字均延迟 2.3 秒,原文译文同屏还能保留音色

同声传译这道高门槛,正在被大模型一步步推成”人人可用”的基础设施。阿里千问推出同声传译大模型 Qwen3.8-LiveTranslate,用一套 Interleave 架构把实时同传从头重构,字均延迟(LAAL)从 2.8 秒压到 2.3 秒,并新增实时说话人分离、原文译文同屏、长上下文消歧等落地能力,目前尝鲜入口与模型 API 均已开放。

一、0.5 秒为什么是分水岭

同传是”慢一秒就跟不上讲话人”的场景,字均延迟直接决定听感是否自然。Qwen3.8-LiveTranslate 把 LAAL 从 2.8 秒降到 2.3 秒——别小看这 0.5 秒,它让译文节奏更贴讲话人,减少”翻译总慢半拍”的割裂感。在已支持 60 种语言的基础上,新模型又在三个维度补齐了同传真正能落地的拼图。

二、补上的三块”实用拼图”

能力 作用
实时说话人分离 每句话归到对应的人,音色复刻更稳,避免甲乙不分、声音串味
原文译文同帧同出 双语同屏显示,听的人能边听边对照
长上下文消歧 联系前文读懂当下,人名、术语等易错点精准度提升

三、架构:Hybrid MoE 下的 Thinker–Talker 双模块

底子是 Hybrid MoE(混合专家)配合 Thinker–Talker 双模块设计,靠 Interleave 把流式理解、文本输出和语音生成串成一条线:

  • Thinker:把视频、音频、原文和译文编排进同一条因果序列,按时序交替排列、端到端产出,让”听懂”和”译出”在同一个序列里完成;
  • Talker:拿着译文和源音频,把译文合成为保留原说话人音色的语音——翻译出来的声音,还是那个讲话人的声音。

四、评测:两个公开基准都领先

在覆盖 14 个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,它在翻译忠实度、流畅度、简洁度以及说话人分离错误率(DER)四个维度,全部压过当前行业主流实时同传系统;在公开 FLEURS 测试集的 70 个语言方向里,它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上,同样领先上一代与主流系统。两项基准说明,这次升级不是单点刷分,而是系统性的听感与准确度双线提升。

五、它意味着什么

当字均延迟降到 2.3 秒、又能稳定保留说话人音色、还能多人交替发言归属清晰,同传从”专业译员把守”走向”会议、直播、跨国协作人人可用”的拐点正在临近。对跨境会议、出海内容、国际直播等场景,这类模型的实用价值远大于参数规模本身。

常见问题(FAQ)

Qwen3.8-LiveTranslate 的字均延迟是多少?

字均延迟(LAAL)从 2.8 秒降至 2.3 秒,在实时同传场景下显著改善听感与跟讲节奏。

它支持多少种语言?

模型已支持 60 种语言,并在新增的实时说话人分离、原文译文同屏、长上下文消歧等能力上进一步提升实用性。

翻译出来的声音和原讲话人一样吗?

一样。Talker 模块在合成译文语音时会保留原说话人音色,配合实时说话人分离,多人交替发言也能清晰归属。

小结

Qwen3.8-LiveTranslate 的价值不在”又一个翻译模型”,而在它用 Interleave 架构把同传的听感、准确度与落地能力一起补齐:2.3 秒字均延迟、60 种语言、说话人分离与音色保留。当这些能力同时成立,同传正从专业门槛滑向人人可用的基础设施——而这,恰恰是大模型最该啃的”硬骨头”。

消息来源:aibase — 千问发布 Qwen3.8-LiveTranslate 同声传译大模型:字均延迟压到 2.3 秒(数据以原报道为准)。

相关阅读

这条线上还有几篇站内文章可以接着看: