腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview。官方公布的词错误率(WER)数据为:中文普通话 3.34%、英语 2.62%、粤语 3.12%。模型覆盖粤语、吴语等十大方言片区及二十余个二级小片区,支持普通话、英语与中英混说,并可识别地铁、街道、工厂、KTV 等高噪声环境语音。目前该模型已首发接入腾讯元宝,同时通过腾讯云开放 API。
三个公开的 WER 数字
词错误率 WER 是语音识别领域最通用的准确率口径,统计的是插入、删除、替换三类错误占总词数的比例,数值越低越好。混元这次公开的三组数据是:
| 语种/方言 | WER | 说明 |
|---|---|---|
| 中文普通话 | 3.34% | 模型主打的标准发音场景 |
| 英语 | 2.62% | 单独英文语音识别 |
| 粤语 | 3.12% | 方言方向的最低值,接近普通话水平 |
粤语能做到 3.12%,比普通话还低,这一点值得注意。方言识别通常受训练数据规模限制,表现往往弱于通用语种;而粤语拥有较稳定的书写习惯与较大规模的可用语料,加之粤港澳地区内容数据丰富,使其在方言序列里属于”数据条件最好”的一类。相比之下,更多缺少书面语习惯的小片方言,识别难度要高得多。
从”听清楚”到”听懂你在说什么”
传统语音识别主要依赖声学信号做逐字转写,得到一个发音上正确的字符串;至于这个字符串在语义上是否成立,交给下游 NLP 处理。Hy ASR 3.0 preview 的升级之处在于:它把 Hy3 大语言模型的语言理解能力引入了识别环节,先结合前后文判断语境与表达意图,再生成对应文字。
最直观的例子是同音或近音短语的消歧:”期中考试”与”期终考试”、”致癌物质”与”治癌物质”,声学层面几乎无法区分,但放进上下文里,正确项通常是唯一的。模型被期望做的是利用上下文完成消歧和纠错,而不是把选择权留给用户。
这个方向上的取舍很清楚:好处是端到端输出可用性更高,减少后处理模块和人工校对;代价是识别环节要等待更多上下文,对实时流的时延控制提出更高要求。
方言与多语言覆盖
官方披露的覆盖范围是十大方言片区及二十余个二级小片区,明确点名包括粤语、吴语,同时支持普通话、英语和中英混说。
中英混说是国内职场与技术场景里真实存在的高频痛点:一句话里夹杂英文术语、产品名、缩写,很多识别系统会在这个切换点上大面积出错。把它与方言能力并列为卖点,说明模型训练时有针对性地构造过这类混合语料。
专业术语与热词注入
识别工具的另一个常见失败点是专业术语。金融、科研、游戏等行业的词汇分布与通用语料差异很大,通用模型很难凭先天覆盖。Hy ASR 3.0 preview 在两个方面给出了应对:
- 行业术语增强:面向金融、科研、游戏等领域的专业表达做针对性优化。
- 热词注入:企业可把品牌名称、产品名称、人名和业务术语注入模型,提升特定场景下的识别准确率。
热词注入是落地成本最低的一种定制手段:不需要重新训练,只需提供词表,即可在特定业务的识别上获得立竿见影的改善。对于客服、会议和内部知识库这类词汇相对封闭的场景,效果通常比通用模型好很多。
复杂声学环境专门优化
实验室数据好看不等于真实可用。Hy ASR 3.0 preview 对高噪声、耳语、低音量三类场景做了专项优化,官方列出的可用环境包括地铁站、街道、工厂、KTV、咖啡厅和办公室。这几处几乎覆盖了日常可能遇到的典型噪声类型:交通低频轰鸣、人流嘈杂、机器规律性噪声、背景音乐与混响。
| 环境类型 | 典型挑战 | 适用场景举例 |
|---|---|---|
| 地铁站/街道 | 低频轰鸣与人声混杂 | 移动场景语音输入、语音搜索 |
| 工厂 | 规律性机械噪声、远距离拾音 | 巡检记录、现场作业日志 |
| KTV/咖啡厅 | 强背景音乐、混响 | 社交娱乐类语音交互 |
| 办公室 | 多人交叠说话、低音量 | 会议转写、访谈整理 |
技术底座:MoE 架构配 Hy3 基座
架构层面,Hy ASR 3.0 preview 采用MoE 混合专家架构,基座模型升级至 Hy3。语音侧使用腾讯混元自研的无监督语音 Encoder,并通过数千万小时级、多来源语音数据进行联合训练。后训练阶段围绕通用转写、上下文理解、专业词汇和复杂长尾场景做了 SFT 与多阶段强化学习。
无监督语音 Encoder 的价值在于绕开标注数据的瓶颈——高质量人工转写音频的成本极高,而原始语音数据量巨大。先用自监督方式从海量未标注语音里学出通用声学表示,再用相对少量的标注数据做对齐与后训练,是当前语音大模型的主流路线。
落地入口与适用场景
模型已首发接入腾讯元宝,用户可在元宝中通过语音输入体验方言识别、专业术语、同音词纠错及复杂环境识别能力,WorkBuddy 等腾讯产品也在陆续接入。
企业侧,模型通过腾讯云提供 API 服务,官方列出的目标场景包括:智能客服、会议转写、音视频字幕、内容理解、语音搜索和企业知识库。企业还可叠加热词注入,对特定品牌、产品及行业术语做定制增强。
常见问题
Hy ASR 3.0 preview 支持哪些方言?
官方披露覆盖粤语、吴语等十大方言片区以及二十余个二级小片区,同时支持普通话、英语和中文英文混说。
企业如何提升自家业务的识别准确率?
可通过腾讯元宝体验基础能力;企业侧通过腾讯云 API 接入,并结合热词注入,把品牌名、产品名、人名和业务术语加入词表,以提升垂直场景准确率。
和传统语音识别比,核心差别在哪?
传统方案主要依赖声学信号做逐字转写;Hy ASR 3.0 preview 结合上下文语义判断表达意图后再输出文字,主要解决同音词误判、专业术语错写和复杂环境下的识别错误。
小结
Hy ASR 3.0 preview 的核心升级,是让语音识别从”尽量听清用户说了什么”,进一步走向”结合上下文理解用户想表达什么”。3.34% 的普通话 WER 与 3.12% 的粤语 WER 说明难任务已经逼近简单任务的水平;而方言覆盖、术语与热词注入、复杂声学环境这三项,恰好对应真实业务中最常见的三类失败。对会议纪要、访谈转写、客服质检和方言语音输入等场景来说,语义感知能力的加入有望显著减少后处理工作量。
