MAI-Transcribe-2 发布:60 语种 FLEURS 词错率 5.2%,每小时 0.1 美元

结论先行:微软 AI 团队发布了第二代语音转写模型 MAI-Transcribe-2。它在 FLEURS 基准的 60 种语言上取得 5.2% 的平均词错误率(WER),位列第一;在 Artificial Analysis 的英文语音转写榜上排名第二,同时定义了准确率与延迟的帕累托前沿。上线限时价格为每小时音频 0.10 美元(约 0.67 元人民币),优惠持续到 2026 年底。

关键指标一览

指标 表现
支持语言 60 种,带自动语言识别
FLEURS 平均 WER 5.2%(强制语种与自动推断语种两种模式下均为该值)
FLEURS 排名 60 语种第一
AA 英文榜排名 第二
速度 比 GPT-Transcribe 快 10×、比 Scribe v2 快 7×、比 Gemini 3.5 Transcribe 快 5×
长音频吞吐 1 小时音频约 10 秒完成转写
价格 0.10 美元 / 小时(限时优惠至 2026 年底)
可用渠道 Microsoft Foundry、MAI Playground、OpenRouter

FLEURS 横向对比:5.2% 到底领先多少

微软官方模型卡公布的是 FLEURS 测试集上 60 种语言的平均词错误率,同时列出了强制语种(forced language)与自动推断语种(inferred language)两种模式。这两个数的差值本身很有信息量——它衡量的是”不告诉模型语种,它还能不能稳住”。

模型 强制语种 WER 自动推断语种 WER
MAI-Transcribe-2 5.2% 5.2%
Gemini 3.1 Pro 5.8% 5.3%
Gemini 3.5 Transcribe* 5.9% 8.6%
Scribe V2 6.2% 6.2%(另有 0.1 增量口径)
Gemini 3.6 Flash* 6.9% 9.4%
GPT-Transcribe 10.4% 10.6%
Whisper V3-Large 22.8% 23.5%

* Gemini 3.5 Transcribe 的乌尔都语、Gemini 3.6 Flash 的保加利亚语等部分语种结果沿用 Gemini 3.1 Pro 的成绩,官方模型卡对此有明确脚注。引用这组数据时,脚注不能省略。

真正拉开差距的不是第一名的 5.2%,而是竞品在两种模式之间的跳变幅度:Gemini 3.5 Transcribe 从 5.9% 掉到 8.6%,Gemini 3.6 Flash 从 6.9% 掉到 9.4%,而 MAI-Transcribe-2 保持不变。对 multilingual 的真实业务来说,”不用预先指定语种”的稳定性往往比峰值准确率更值钱。

速度与价格:便宜且快,通常二者不可兼得

微软引用 Artificial Analysis 的评测数据称,MAI-Transcribe-2 比 OpenAI 的 GPT-Transcribe 快 10 倍,比 ElevenLabs 的 Scribe v2 快 7 倍,比 Gemini 3.5 Transcribe 快 5 倍,且在更快的同时准确率更高。官方给出的直观参照是:1 小时音频约 10 秒完成转写。

定价方面,上线价是每小时音频 0.10 美元,官方表述为限时优惠,持续到 2026 年底。按第三方换算约合 0.67 元人民币每小时。对需要批量处理历史录音的客户,这个量级的单价足以改变”要不要全量转写”的决策。

这代新增的能力

说话人分离 + 词级时间戳

说话人分离(diarization)能在同一段录音里区分不同发言人并把文本归到对应的人名下;词级时间戳则为每个词标注精确起止位置。两者叠在一起,才可能回答”谁在什么时间说了什么”——这是会议纪要、庭审记录、客服质检的共同底座。单纯的高准确率文本输出做不到这一点。

verbatim 与 clean 两种转写风格

模式 行为 适用
verbatim 逐字保留语气词、重复与口误 合规存档、会话分析
clean 剔除不流畅成分,输出可读文本 字幕、笔记、公开发布稿

关键词偏置、语码转换与噪声鲁棒性

关键词偏置(keyword biasing)允许开发者把行业术语、缩写、人名传给模型,提升这些难词在上下文不足时的识别率。语码转换(code switching)支持对话在语言之间自然切换,包括印地英语(Hinglish)、西语英语混用(Spanglish)这类常见混合语种。此外模型卡强调了在非受控录音环境下的稳健表现。

落地场景

场景 依赖的关键能力
客服中心通话质检 说话人分离 + 词级时间戳 + 批量低价
临床病历口述转写 关键词偏置(药名、术语)+ verbatim 合规留存
法律文书与庭审记录 verbatim 模式 + 说话人归属
无障碍与字幕生成 clean 模式 + 低延迟
全球多语种产品 60 语种 + 自动语言识别 + 语码转换

FAQ

1. 5.2% 的词错误率意味着什么?

词错误率是”错误词数 ÷ 总词数”,数值越低越好。5.2% 大致相当于每 100 个词里有 5 个左右需要修正。这已经足以承担字幕、纪要等场景,但在医疗、法律等高风险领域,仍需人工复核环节,不能直接作为定稿。

2. 0.10 美元/小时的价格会不会变?

官方明确这是限时推广价,有效期至 2026 年底。做长期成本核算时,建议按恢复原价后的水平做敏感性测算,不要以促销价作为唯一预算基准。

3. 它比 Whisper V3-Large 强在哪?

差距在 FLEURS 上非常直观:Whisper V3-Large 为 22.8% / 23.5%,MAI-Transcribe-2 为 5.2%。此外后者原生支持说话人分离、词级时间戳、语码转换等 Whisper 需要通过外部组件补齐的功能。

小结

语音转写的竞争维度已经从”识别得准”扩展到了”能不能直接进业务流程”。MAI-Transcribe-2 的三个坐标——60 语种 5.2% 且在自动推断模式下不退化、约 10 倍于主流竞品的速度、0.10 美元每小时的定价——分别对应质量、体验与成本。真正的分水岭在于它把说话人分离和词级时间戳做成了原生能力:这让输出不再是一段扁平文本,而是一份带结构、可直接被下游系统消费的数据。

相关阅读

这条线上还有几篇站内文章可以接着看: