千问在 9 月 23 日把整条语音模型线换了个代次。Qwen-Audio-3.1 一次发布五款模型,覆盖识别、理解、合成、创作和实时交互五个环节,同时把价格整体往下压:ASR 降 95%,Realtime 降 85%,TTS 降 70%。如果你在做语音相关的应用,最值得盯的是 ASR 的降价幅度,它把语音识别的调用成本压到了几乎可以忽略的水平,模型数量反而是次要信息。
五款模型分别干什么
这一代把原来散在几个模型里的能力拆成了更细的五块。识别和理解分开,合成和创作分开,实时交互单独一个模型,各有明确分工。
ASR:转写完还能顺手润色
Qwen-Audio-3.1-ASR 是这一代的主力识别模型。它新增了原生转写润色,能自动去掉口语里的语气词和重复表达,再把句子重组一遍,输出的是整理后的文本,和原始录音的逐字稿差别不小。分角色转写也是原生能力,说话人标签、时间戳和文本一起输出,会议和访谈场景省掉一道后处理。
语种上一套模型支持 30 种语言和 16 种中文方言,行业词和分级热词也能识别。流式识别的首字响应约 160 毫秒,做实时字幕这类需求够用了。
ASR-Next:从听文字到听环境
ASR-Next 用的是下一代架构,处理对象从语音里的文字扩展成了整段音频。除了文字,它还能理解说话人的情绪、环境声和机械声,可以做声音描述、事件定位和音频问答推理。官方给出的对比是,Flash-Next 与 Flash 版本在分角色 ASR 评测的四测试集八项指标中分别拿到五项与三项最优,全面优于此前的 Fun-ASR 级联系统。这里说的 Fun-ASR,就是千问此前那套语音方案,我们之前写过 Fun-ASR-Realtime 的升级,级联架构换成端到端之后,这类提升其实在预期之内。
TTS 与 TTS-Next:一个负责说话,一个负责出片
Qwen-Audio-3.1-TTS 支持多语种和方言合成,主打同一音色在跨语言时自然迁移,情绪、语速和表达方式都能用指令控制。
TTS-Next 走的是另一条路,它围绕文本、时间戳和参考音频,把人声、音效和环境音一次性生成出来,支持 48kHz 输出和细粒度时间戳控制。播客、有声书、影视配音和游戏音频是它的目标场景,这类需求以前要拼接多个工具,现在是一次调用的事。
Realtime:全双工,随时能插话
Qwen-Audio-3.1-Realtime 采用多教师蒸馏架构,做了全双工交互,能同时听和说,用户可以随时打断。它从单纯识别文字升级到理解情绪和交流意图,官方举的例子是识别到用户语气低落时会放慢语速、调整措辞。多语言实时切换、对话中调用 API 和知识库工具也在支持范围内。
实测数据,方言这块进步最明显
千问官方公布的几组数据值得单独拎出来看:
| 测试项 | 结果 | 说明 |
|---|---|---|
| KeSpeech 与 WSYue 共 11 个子集平均 CER | 4.55% | 开源方言测试集 |
| 中文方言内部测试集平均 CER | 10.38% | 自建集 |
| 方言转普通话平均语义句准率 | 82.10% | AST 指标 |
| 流式识别首字响应 | 约 160 毫秒 | 低延迟流式 |
| 语种覆盖 | 30 种语言、16 种中文方言 | 单模型 |
方言一直是中文语音识别的老大难,10.38% 的 CER 放在内部测试集上算不错,但要注意这是自建集的数字,跨到自己的业务数据上通常还要再打折。我倾向的看法是,普通话场景可以放心切,重方言场景先拿自己的音频跑一遍再决定。
降价幅度是这次的关键变量
| 模型 | 降价幅度 |
|---|---|
| ASR | 约 95% |
| Realtime | 约 85% |
| TTS | 约 70% |
ASR 降 95% 是个很激进的数字。语音识别在很多产品里属于高频调用,成本下降一个数量级,意味着以前因为成本放弃的场景可以重新捡回来,比如长录音全量转写、会议全程记录、客服会话逐条入库。这波降价思路和此前 Qwen3.8-Omni-Flash 把音频输入价格降 98% 是一脉相承的,千问明显在用价格换语音入口的调用量。
和同赛道的其他语音模型怎么比
近期语音模型发布得很密集,各家打法不太一样。StepAudio 3 系列也是五款模型一起发,Realtime 拿到 98.9 分、ASR 词错率 1.7%;混元 Hy ASR 3.0 preview 的普通话词错误率是 3.34%,覆盖十大方言和中英混说;Kimi-Audio 在 LibriSpeech 上词错误率 1.28%,走的是开源路线。
需要提醒的是,这些数字的测试口径并不统一,普通话词错误率和方言平均 CER 不能直接比大小,混元的 3.34% 和 Qwen 的 4.55% 不是同一件事。真要选型,还是拿自己的音频集跑一遍最可靠。
和上一代相比,Qwen-Audio-3.0 只有 ASR、TTS、Realtime 三款,3.1 补上了音频理解和音频创作两块,栈才算完整。
已经接到哪些产品里
Realtime 目前正接入 Qoder、千问办公这类 Agent,以及 QwenNote、A2、Eva、千问 AI 眼镜、乐奇 AI 眼镜等硬件。官方描述的场景是用户不用一直开着电脑或手机,用语音直接发起任务,在对话过程中追加条件、修改需求或查询执行进度。眼镜这类形态对语音的依赖天然更强,语音模型的能力上限直接决定了这类硬件能做什么。
常见问题
Qwen-Audio-3.1 和 3.0 的差别在哪
3.0 是三款模型,覆盖识别、合成和实时交互;3.1 扩到五款,新增了音频理解模型 ASR-Next 和音频创作模型 TTS-Next,同时三款老模型全线降价。能力上最大的变化是识别之外多了对整段音频的理解,以及一次生成人声、音效和环境音的创作能力。
ASR 降 95% 之后具体多少钱
官方这次只公布了降幅比例,没有给出逐档的计费明细。按千问 AI 平台上给出的模型页价格为准,我暂时没法确认具体到每百万 token 或每小时音频的金额,建议直接查模型页。
五款模型的 API 都上架了吗
ASR、TTS、TTS-Next 和 Realtime 的 API 已经在千问 AI 平台开放,ASR-Next 的 API 官方标注为即将上线,现在还调不了。
方言识别能直接上生产吗
普通话场景基本没问题。方言部分,内部测试集平均 CER 10.38%、方言转普通话语义句准率 82.10%,做字幕草稿、内容归档够用,涉及关键信息摘录的环节建议保留人工复核。
小结
Qwen-Audio-3.1 是一次把品类补齐加把价格打穿的组合动作。五款模型谈不上每一项都是第一,但覆盖完整,加上 ASR 降价 95%,对开发者来说试错成本几乎为零。接下来值得观察的是 ASR-Next 上线后的实际表现,以及这套音频能力在 AI 眼镜这类硬件上能跑出什么体验。
相关阅读
- Qwen-Audio-3.0 上线:ASR、TTS、Realtime 三箭齐发
- Fun-ASR-Realtime 升级:30 种语言与 16 种方言
- Qwen3.8-Omni-Flash 全模态:音频输入降价 98%
- StepAudio 3 系列:五款语音模型
- 混元 Hy ASR 3.0 preview 解析
延伸阅读
- LLaDA-Image 开源:6B DiT 统一生成与编辑,Qwen-Image-Bench 中英双料第一3 天前
- 智象未来发布 HiDream-O1-World:全球首个原生全模态交互式世界模型3 周前
- Meta Muse 发布引爆股市:13 天登顶 App Store,股价涨 11.43%,亚马逊却拉黑了它5 小时前
- 腾讯开源 EVIE-Preview-4.5B:不用 OCR 的文档检索,4.5B 参数拿了 ViDoRe 第一3 周前
