Qwen-Audio-3.1 发布:五款语音模型齐发,ASR 降价 95%

千问在 9 月 23 日把整条语音模型线换了个代次。Qwen-Audio-3.1 一次发布五款模型,覆盖识别、理解、合成、创作和实时交互五个环节,同时把价格整体往下压:ASR 降 95%,Realtime 降 85%,TTS 降 70%。如果你在做语音相关的应用,最值得盯的是 ASR 的降价幅度,它把语音识别的调用成本压到了几乎可以忽略的水平,模型数量反而是次要信息。

五款模型分别干什么

这一代把原来散在几个模型里的能力拆成了更细的五块。识别和理解分开,合成和创作分开,实时交互单独一个模型,各有明确分工。

ASR:转写完还能顺手润色

Qwen-Audio-3.1-ASR 是这一代的主力识别模型。它新增了原生转写润色,能自动去掉口语里的语气词和重复表达,再把句子重组一遍,输出的是整理后的文本,和原始录音的逐字稿差别不小。分角色转写也是原生能力,说话人标签、时间戳和文本一起输出,会议和访谈场景省掉一道后处理。

语种上一套模型支持 30 种语言和 16 种中文方言,行业词和分级热词也能识别。流式识别的首字响应约 160 毫秒,做实时字幕这类需求够用了。

ASR-Next:从听文字到听环境

ASR-Next 用的是下一代架构,处理对象从语音里的文字扩展成了整段音频。除了文字,它还能理解说话人的情绪、环境声和机械声,可以做声音描述、事件定位和音频问答推理。官方给出的对比是,Flash-Next 与 Flash 版本在分角色 ASR 评测的四测试集八项指标中分别拿到五项与三项最优,全面优于此前的 Fun-ASR 级联系统。这里说的 Fun-ASR,就是千问此前那套语音方案,我们之前写过 Fun-ASR-Realtime 的升级,级联架构换成端到端之后,这类提升其实在预期之内。

TTS 与 TTS-Next:一个负责说话,一个负责出片

Qwen-Audio-3.1-TTS 支持多语种和方言合成,主打同一音色在跨语言时自然迁移,情绪、语速和表达方式都能用指令控制。

TTS-Next 走的是另一条路,它围绕文本、时间戳和参考音频,把人声、音效和环境音一次性生成出来,支持 48kHz 输出和细粒度时间戳控制。播客、有声书、影视配音和游戏音频是它的目标场景,这类需求以前要拼接多个工具,现在是一次调用的事。

Realtime:全双工,随时能插话

Qwen-Audio-3.1-Realtime 采用多教师蒸馏架构,做了全双工交互,能同时听和说,用户可以随时打断。它从单纯识别文字升级到理解情绪和交流意图,官方举的例子是识别到用户语气低落时会放慢语速、调整措辞。多语言实时切换、对话中调用 API 和知识库工具也在支持范围内。

实测数据,方言这块进步最明显

千问官方公布的几组数据值得单独拎出来看:

测试项 结果 说明
KeSpeech 与 WSYue 共 11 个子集平均 CER 4.55% 开源方言测试集
中文方言内部测试集平均 CER 10.38% 自建集
方言转普通话平均语义句准率 82.10% AST 指标
流式识别首字响应 约 160 毫秒 低延迟流式
语种覆盖 30 种语言、16 种中文方言 单模型

方言一直是中文语音识别的老大难,10.38% 的 CER 放在内部测试集上算不错,但要注意这是自建集的数字,跨到自己的业务数据上通常还要再打折。我倾向的看法是,普通话场景可以放心切,重方言场景先拿自己的音频跑一遍再决定。

降价幅度是这次的关键变量

模型 降价幅度
ASR 约 95%
Realtime 约 85%
TTS 约 70%

ASR 降 95% 是个很激进的数字。语音识别在很多产品里属于高频调用,成本下降一个数量级,意味着以前因为成本放弃的场景可以重新捡回来,比如长录音全量转写、会议全程记录、客服会话逐条入库。这波降价思路和此前 Qwen3.8-Omni-Flash 把音频输入价格降 98% 是一脉相承的,千问明显在用价格换语音入口的调用量。

和同赛道的其他语音模型怎么比

近期语音模型发布得很密集,各家打法不太一样。StepAudio 3 系列也是五款模型一起发,Realtime 拿到 98.9 分、ASR 词错率 1.7%;混元 Hy ASR 3.0 preview 的普通话词错误率是 3.34%,覆盖十大方言和中英混说;Kimi-Audio 在 LibriSpeech 上词错误率 1.28%,走的是开源路线。

需要提醒的是,这些数字的测试口径并不统一,普通话词错误率和方言平均 CER 不能直接比大小,混元的 3.34% 和 Qwen 的 4.55% 不是同一件事。真要选型,还是拿自己的音频集跑一遍最可靠。

和上一代相比,Qwen-Audio-3.0 只有 ASR、TTS、Realtime 三款,3.1 补上了音频理解和音频创作两块,栈才算完整。

已经接到哪些产品里

Realtime 目前正接入 Qoder、千问办公这类 Agent,以及 QwenNote、A2、Eva、千问 AI 眼镜、乐奇 AI 眼镜等硬件。官方描述的场景是用户不用一直开着电脑或手机,用语音直接发起任务,在对话过程中追加条件、修改需求或查询执行进度。眼镜这类形态对语音的依赖天然更强,语音模型的能力上限直接决定了这类硬件能做什么。

常见问题

Qwen-Audio-3.1 和 3.0 的差别在哪

3.0 是三款模型,覆盖识别、合成和实时交互;3.1 扩到五款,新增了音频理解模型 ASR-Next 和音频创作模型 TTS-Next,同时三款老模型全线降价。能力上最大的变化是识别之外多了对整段音频的理解,以及一次生成人声、音效和环境音的创作能力。

ASR 降 95% 之后具体多少钱

官方这次只公布了降幅比例,没有给出逐档的计费明细。按千问 AI 平台上给出的模型页价格为准,我暂时没法确认具体到每百万 token 或每小时音频的金额,建议直接查模型页。

五款模型的 API 都上架了吗

ASR、TTS、TTS-Next 和 Realtime 的 API 已经在千问 AI 平台开放,ASR-Next 的 API 官方标注为即将上线,现在还调不了。

方言识别能直接上生产吗

普通话场景基本没问题。方言部分,内部测试集平均 CER 10.38%、方言转普通话语义句准率 82.10%,做字幕草稿、内容归档够用,涉及关键信息摘录的环节建议保留人工复核。

小结

Qwen-Audio-3.1 是一次把品类补齐加把价格打穿的组合动作。五款模型谈不上每一项都是第一,但覆盖完整,加上 ASR 降价 95%,对开发者来说试错成本几乎为零。接下来值得观察的是 ASR-Next 上线后的实际表现,以及这套音频能力在 AI 眼镜这类硬件上能跑出什么体验。


相关阅读