在把错误率压低约一半的同时,定价一分没涨——这是 Grok Voice Transcribe 2.0 最”不讲道理”的一招。当地时间 9 月 18 日,SpaceX 旗下人工智能部门 SpaceXAI 放出新一代语音转文本模型 Grok Voice Transcribe 2.0。它扎根于 Grok Voice 音频底座,而这套底座早已深度嵌入真实业务:每天接住数万通客服电话、转录数百万小时视频旁白,还驱动着特斯拉车机上的 Grok 助手等硬件语音智能体。
一、榜单成绩:32 款流式模型准确率第一
| 维度 | Grok Voice Transcribe 2.0 |
|---|---|
| Artificial Analysis 流式榜 | 全部 32 款流式模型准确率第一 |
| 错误率 | 较 1.0 降低约一半 |
| 定价 | 与 1.0 持平,未上涨 |
| 日处理量 | 数万通客服电话 / 数百万小时视频旁白 |
它不是实验室里跑分的模型,而是已经被海量真实语音反复打磨过的产物。SpaceXAI 还从自家线上业务抽样了四个内部数据集做系统评测,涵盖客服电话录音、与 Grok 的日常英语对话、口述的电话号码与邮箱这类结构化信息,以及多语种短指令——四个数据集上 2.0 对 1.0 实现全面碾压。
二、为什么”价格不变”比”错误率减半”更关键
语音转文本是典型的规模化成本敏感场景:客服、字幕、会议记录都是高频、海量调用。错误率砍半提升体验,而价格纹丝不动则直接决定它能否被大规模铺开。对开发者而言,”又好又便宜”才是部署的真实门槛。
三、落地场景已经跑通
- 客服电话:日接数万通,实时转写与质检;
- 视频旁白:数百万小时级别的旁白转录;
- 车机与硬件语音智能体:驱动特斯拉车机上的 Grok 助手。
这种”先有真实业务、再反哺模型”的路径,让 2.0 的优化目标高度贴合一线需求,而非抽象基准。
四、值得关注的边界
报道重点在英文与多语种短指令场景,中文及极端噪声环境的实测表现仍需观察;此外,错误率虽降,但医疗、法律等高合规要求场景仍建议保留人工校对闭环。
常见问题(FAQ)
Grok Voice Transcribe 2.0 贵吗?
不贵,且价格与 1.0 持平:在错误率降低约一半的同时定价未上涨,对规模化语音转录尤为友好。
它在公开榜单表现如何?
在 Artificial Analysis 的公开榜单上,Grok Voice Transcribe 2.0 在全部 32 款流式模型中准确率排到第一。
已经用在哪些地方?
已深度落地:每天处理数万通客服电话、转录数百万小时视频旁白,并驱动特斯拉车机 Grok 助手等硬件语音智能体。
小结
Grok Voice Transcribe 2.0 的打法很清晰:用真实业务喂出来的模型,在基准与内部数据集上双线碾压 1.0,却把价格钉死不动。在语音识别这条”拼规模、拼成本”的赛道上,这种”体验升级、账单不变”的策略,往往比单纯刷分更有杀伤力。
消息来源:aibase — SpaceXAI 推出 Grok Voice Transcribe 2.0:错误率砍半、价格纹丝不动(数据以原报道为准)。
相关阅读
这条线上还有几篇站内文章可以接着看:
- MAI-Transcribe-2 发布:60 语种 FLEURS 词错率 5.2%,每小时 0.1 美元
- Grok Imagine Video 1.5 发布:xAI 图像生成视频模型登顶排行榜,Elo 分数超越 Seedance 2.0
- Grok 4.6 发布:追平 GPT-5.6 Sol 的分数,Fable 5 级性能两折价
延伸阅读
- Grok 4.6 发布:追平 GPT-5.6 Sol 的分数,Fable 5 级性能两折价1 月前
- OpenAI发布GPT-5.6-Cyber:周五叫停Astra,周一上线拒绝更少的黑客模型1 月前
- Google Gemini 3.5 Pro 传7月17日发布:全新预训练重塑底座,前端能力叫板Fable 53 月前
- Kimi K3正式发布:2.8万亿参数炸场,Claude Fable 5和GPT-5.6都被比下去了2 月前
