StepAudio 3 系列发布:五款语音模型,Realtime 98.9 分登顶、ASR 词错率 1.7%

结论先行:阶跃星辰把语音大模型从”单模型”拆成了”模型矩阵”。9 月 15 日,阶跃星辰推出 StepAudio 3 系列语音大模型,一次性发布 Realtime、ASR、TTS、Gen、Music 五款模型,多款在 Artificial Analysis 榜单上位列全球第一。其中 Realtime 以 98.9% 的综合得分登顶实时语音交互榜首,ASR 词错误率仅 1.7%,并列第一。模型覆盖实时对话、语音识别、真人级语音合成、全音频生成与音乐创作五类场景。

一、五款模型各自负责什么

把语音能力拆成五款模型,背后是对场景的清醒认识:实时对话、识别、合成、通用音频生成与音乐创作,优化目标彼此冲突。实时对话要低延迟,识别要准确率和鲁棒性,合成要自然度和可控性,音乐创作要结构感和听感。用一个模型兼顾所有目标,往往意味着每个目标都做不到极致。

模型 职责 典型场景
Realtime 实时语音交互 语音客服、口语陪练、车内与家居助手
ASR 语音识别转写 会议记录、字幕生成、通话质检
TTS 语音合成 有声书、播报、数字人配音
Gen 全音频生成 音效、配乐素材、环境声构建
Music 音乐创作 背景音乐、demo 小样、短视频配乐

二、98.9 分与 1.7%:两个数字的分量

Realtime 在 Artificial Analysis 实时语音交互榜以 98.9% 的综合得分登顶。实时语音交互的评分通常不止看”听懂没有”,还要看响应是否及时、能否处理被打断、语气是否自然——这些维度合起来才是”像人一样对话”的体验。98.9% 的意义在于,实时语音这条最难兼顾”快”与”准”的赛道,头部水平已经逼近体验无损的门槛。

ASR 的 1.7% 词错误率同样关键。词错误率(WER)是语音识别最核心的指标,1.7% 意味着每 100 个词大约错 1.7 个,已经达到人工速记员水准。对会议纪要、司法庭审记录、医疗口述这类对准确性零容忍的场景,这个量级把”机器转写后仍需全篇人工校对”,推进到”只需抽查修正专有名词”。

三、从 StepAudio 2.5 到 3:能力是怎么叠上来的

理解 StepAudio 3 的位置,需要看它前面几代做了什么。阶跃星辰在 StepAudio 2.5 阶段已经把语音能力拆开迭代:2.5 Realtime 主打副语言能力,可感知语调、语速、停顿等情绪细节,并支持千万级人设自定义,从性格到口癖都能调节;2.5 ASR 率先把大语言模型的推理加速技术引入语音识别,基于 ASR+MTP-5 架构实现推理速度提升 400%、时延降低 60%、峰值达 500 tokens/s、成本下降 80%,复用 32K 上下文窗口,单次可完整转写 30 分钟长音频;2.5 TTS 则提供全局语境控制、文中语境控制和零样本复刻三项能力,用自然语言即可调控情绪基调、语气节奏与停顿重音。

StepAudio 3 的突破在于把这些分散的能力点整合进同一代技术栈,并补齐了全音频生成与音乐创作两块拼图。从”能听会说”到”能创作”,是语音模型从交互工具迈向内容生产工具的转折。

四、语音赛道为什么突然变热

语音是大模型最贴近真实交互的入口。文本交互需要用户主动打字,语音交互则允许”边做别的事边说”,这决定了它在车载、家居、穿戴设备上的不可替代性。同时,语音也是 Agent 能力落地的关键一环——一个只能打字的智能体,使用门槛远高于一个能听会说的智能体。

更重要的是成本曲线。语音处理长期受限于算力与时延,随着模型架构优化(例如把 LLM 推理加速技术迁移到语音识别),单位推理成本快速下降,原本只在少数高端场景成立的语音应用,开始具备规模化部署的经济性。

五、选型时的几个现实判断

如果业务核心是对话体验,Realtime 是首选,但要注意实时链路对网络抖动的敏感,弱网环境需预备降级策略。如果核心是记录准确性,ASR 的 1.7% 词错率很有吸引力,但专业术语密集的场景(如医学、法律)仍建议叠加领域词表。如果核心是内容生产,TTS 与 Music 打开了有声内容和配乐的自动化空间,不过在商用前需要确认音色授权与版权边界。至于 Gen 这类全音频生成能力,更适合作为创意辅助而非最终成品。

六、常见问题(FAQ)

Q1:StepAudio 3 是一个模型还是五个模型?

是一个系列,包含 Realtime、ASR、TTS、Gen、Music 五款模型。它们面向不同任务分别优化,开发者按场景选用或组合,而不是用单一模型覆盖全部语音需求。

Q2:1.7% 的词错误率在实际业务中够用吗?

对大多数通用场景已经接近可用上限,通常只需修正人名、地名、行业术语等专有名词。但医疗、法律等容错率极低的场景,仍建议叠加领域词表与人工复核,不要直接采信原始转写结果。

Q3:语音合成与音乐生成模型的版权风险如何把控?

零样本复刻能力意味着音色可被高度还原,商用前必须确认音色来源的授权链条,避免未经许可复刻真人声音。音乐生成同理,用于商业发行前应核实训练与输出内容的权利归属,并保留生成记录以备追溯。

小结

StepAudio 3 的意义不在”又发了一个语音模型”,而在于它把语音能力结构化了:识别、合成、实时交互、音频生成、音乐创作各有专责模型,各在自己赛道上冲榜,而不是用一个万金油模型勉强兼顾所有指标。98.9% 与 1.7% 这两个数字说明,语音交互在”准”这个维度上已经不再是瓶颈,接下来的竞争会转向延迟、打断处理、情绪理解这些更接近体验的层面。对开发者来说,好消息是选型变清晰了——先想清楚业务到底要”听懂”、”说好”还是”创作”,再挑对应的那款模型。