结论先行:微软 AI 团队发布了第二代语音转写模型 MAI-Transcribe-2。它在 FLEURS 基准的 60 种语言上取得 5.2% 的平均词错误率(WER),位列第一;在 Artificial Analysis 的英文语音转写榜上排名第二,同时定义了准确率与延迟的帕累托前沿。上线限时价格为每小时音频 0.10 美元(约 0.67 元人民币),优惠持续到 2026 年底。
关键指标一览
| 指标 | 表现 |
|---|---|
| 支持语言 | 60 种,带自动语言识别 |
| FLEURS 平均 WER | 5.2%(强制语种与自动推断语种两种模式下均为该值) |
| FLEURS 排名 | 60 语种第一 |
| AA 英文榜排名 | 第二 |
| 速度 | 比 GPT-Transcribe 快 10×、比 Scribe v2 快 7×、比 Gemini 3.5 Transcribe 快 5× |
| 长音频吞吐 | 1 小时音频约 10 秒完成转写 |
| 价格 | 0.10 美元 / 小时(限时优惠至 2026 年底) |
| 可用渠道 | Microsoft Foundry、MAI Playground、OpenRouter |
FLEURS 横向对比:5.2% 到底领先多少
微软官方模型卡公布的是 FLEURS 测试集上 60 种语言的平均词错误率,同时列出了强制语种(forced language)与自动推断语种(inferred language)两种模式。这两个数的差值本身很有信息量——它衡量的是”不告诉模型语种,它还能不能稳住”。
| 模型 | 强制语种 WER | 自动推断语种 WER |
|---|---|---|
| MAI-Transcribe-2 | 5.2% | 5.2% |
| Gemini 3.1 Pro | 5.8% | 5.3% |
| Gemini 3.5 Transcribe* | 5.9% | 8.6% |
| Scribe V2 | 6.2% | 6.2%(另有 0.1 增量口径) |
| Gemini 3.6 Flash* | 6.9% | 9.4% |
| GPT-Transcribe | 10.4% | 10.6% |
| Whisper V3-Large | 22.8% | 23.5% |
* Gemini 3.5 Transcribe 的乌尔都语、Gemini 3.6 Flash 的保加利亚语等部分语种结果沿用 Gemini 3.1 Pro 的成绩,官方模型卡对此有明确脚注。引用这组数据时,脚注不能省略。
真正拉开差距的不是第一名的 5.2%,而是竞品在两种模式之间的跳变幅度:Gemini 3.5 Transcribe 从 5.9% 掉到 8.6%,Gemini 3.6 Flash 从 6.9% 掉到 9.4%,而 MAI-Transcribe-2 保持不变。对 multilingual 的真实业务来说,”不用预先指定语种”的稳定性往往比峰值准确率更值钱。
速度与价格:便宜且快,通常二者不可兼得
微软引用 Artificial Analysis 的评测数据称,MAI-Transcribe-2 比 OpenAI 的 GPT-Transcribe 快 10 倍,比 ElevenLabs 的 Scribe v2 快 7 倍,比 Gemini 3.5 Transcribe 快 5 倍,且在更快的同时准确率更高。官方给出的直观参照是:1 小时音频约 10 秒完成转写。
定价方面,上线价是每小时音频 0.10 美元,官方表述为限时优惠,持续到 2026 年底。按第三方换算约合 0.67 元人民币每小时。对需要批量处理历史录音的客户,这个量级的单价足以改变”要不要全量转写”的决策。
这代新增的能力
说话人分离 + 词级时间戳
说话人分离(diarization)能在同一段录音里区分不同发言人并把文本归到对应的人名下;词级时间戳则为每个词标注精确起止位置。两者叠在一起,才可能回答”谁在什么时间说了什么”——这是会议纪要、庭审记录、客服质检的共同底座。单纯的高准确率文本输出做不到这一点。
verbatim 与 clean 两种转写风格
| 模式 | 行为 | 适用 |
|---|---|---|
| verbatim | 逐字保留语气词、重复与口误 | 合规存档、会话分析 |
| clean | 剔除不流畅成分,输出可读文本 | 字幕、笔记、公开发布稿 |
关键词偏置、语码转换与噪声鲁棒性
关键词偏置(keyword biasing)允许开发者把行业术语、缩写、人名传给模型,提升这些难词在上下文不足时的识别率。语码转换(code switching)支持对话在语言之间自然切换,包括印地英语(Hinglish)、西语英语混用(Spanglish)这类常见混合语种。此外模型卡强调了在非受控录音环境下的稳健表现。
落地场景
| 场景 | 依赖的关键能力 |
|---|---|
| 客服中心通话质检 | 说话人分离 + 词级时间戳 + 批量低价 |
| 临床病历口述转写 | 关键词偏置(药名、术语)+ verbatim 合规留存 |
| 法律文书与庭审记录 | verbatim 模式 + 说话人归属 |
| 无障碍与字幕生成 | clean 模式 + 低延迟 |
| 全球多语种产品 | 60 语种 + 自动语言识别 + 语码转换 |
FAQ
1. 5.2% 的词错误率意味着什么?
词错误率是”错误词数 ÷ 总词数”,数值越低越好。5.2% 大致相当于每 100 个词里有 5 个左右需要修正。这已经足以承担字幕、纪要等场景,但在医疗、法律等高风险领域,仍需人工复核环节,不能直接作为定稿。
2. 0.10 美元/小时的价格会不会变?
官方明确这是限时推广价,有效期至 2026 年底。做长期成本核算时,建议按恢复原价后的水平做敏感性测算,不要以促销价作为唯一预算基准。
3. 它比 Whisper V3-Large 强在哪?
差距在 FLEURS 上非常直观:Whisper V3-Large 为 22.8% / 23.5%,MAI-Transcribe-2 为 5.2%。此外后者原生支持说话人分离、词级时间戳、语码转换等 Whisper 需要通过外部组件补齐的功能。
小结
语音转写的竞争维度已经从”识别得准”扩展到了”能不能直接进业务流程”。MAI-Transcribe-2 的三个坐标——60 语种 5.2% 且在自动推断模式下不退化、约 10 倍于主流竞品的速度、0.10 美元每小时的定价——分别对应质量、体验与成本。真正的分水岭在于它把说话人分离和词级时间戳做成了原生能力:这让输出不再是一段扁平文本,而是一份带结构、可直接被下游系统消费的数据。
相关阅读
这条线上还有几篇站内文章可以接着看:
延伸阅读
- Gemini Notebook 返校更新:讲座录音自动转录,60 秒视频概览支持 80 多种语言2 天前
- 机器学习能识别鸟鸣地域方言,通用大模型却常认错1 天前
- OpenAI 偷偷测试新图像模型,代号 mona-lisa-1,专治 AI 塑料感皮肤1 月前
- 谷歌 Gemini 测试中自主入侵 3 家公司:首次确认 AI 突破测试环境,安全红线告急3 天前
