腾讯混元 Hy ASR 3.0 preview 发布:普通话词错误率 3.34%,覆盖十大方言与中英混说

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview。官方公布的词错误率(WER)数据为:中文普通话 3.34%、英语 2.62%、粤语 3.12%。模型覆盖粤语、吴语等十大方言片区及二十余个二级小片区,支持普通话、英语与中英混说,并可识别地铁、街道、工厂、KTV 等高噪声环境语音。目前该模型已首发接入腾讯元宝,同时通过腾讯云开放 API。

三个公开的 WER 数字

词错误率 WER 是语音识别领域最通用的准确率口径,统计的是插入、删除、替换三类错误占总词数的比例,数值越低越好。混元这次公开的三组数据是:

语种/方言 WER 说明
中文普通话 3.34% 模型主打的标准发音场景
英语 2.62% 单独英文语音识别
粤语 3.12% 方言方向的最低值,接近普通话水平

粤语能做到 3.12%,比普通话还低,这一点值得注意。方言识别通常受训练数据规模限制,表现往往弱于通用语种;而粤语拥有较稳定的书写习惯与较大规模的可用语料,加之粤港澳地区内容数据丰富,使其在方言序列里属于”数据条件最好”的一类。相比之下,更多缺少书面语习惯的小片方言,识别难度要高得多。

从”听清楚”到”听懂你在说什么”

传统语音识别主要依赖声学信号做逐字转写,得到一个发音上正确的字符串;至于这个字符串在语义上是否成立,交给下游 NLP 处理。Hy ASR 3.0 preview 的升级之处在于:它把 Hy3 大语言模型的语言理解能力引入了识别环节,先结合前后文判断语境与表达意图,再生成对应文字。

最直观的例子是同音或近音短语的消歧:”期中考试”与”期终考试”、”致癌物质”与”治癌物质”,声学层面几乎无法区分,但放进上下文里,正确项通常是唯一的。模型被期望做的是利用上下文完成消歧和纠错,而不是把选择权留给用户。

这个方向上的取舍很清楚:好处是端到端输出可用性更高,减少后处理模块和人工校对;代价是识别环节要等待更多上下文,对实时流的时延控制提出更高要求。

方言与多语言覆盖

官方披露的覆盖范围是十大方言片区及二十余个二级小片区,明确点名包括粤语、吴语,同时支持普通话、英语和中英混说。

中英混说是国内职场与技术场景里真实存在的高频痛点:一句话里夹杂英文术语、产品名、缩写,很多识别系统会在这个切换点上大面积出错。把它与方言能力并列为卖点,说明模型训练时有针对性地构造过这类混合语料。

专业术语与热词注入

识别工具的另一个常见失败点是专业术语。金融、科研、游戏等行业的词汇分布与通用语料差异很大,通用模型很难凭先天覆盖。Hy ASR 3.0 preview 在两个方面给出了应对:

  • 行业术语增强:面向金融、科研、游戏等领域的专业表达做针对性优化。
  • 热词注入:企业可把品牌名称、产品名称、人名和业务术语注入模型,提升特定场景下的识别准确率。

热词注入是落地成本最低的一种定制手段:不需要重新训练,只需提供词表,即可在特定业务的识别上获得立竿见影的改善。对于客服、会议和内部知识库这类词汇相对封闭的场景,效果通常比通用模型好很多。

复杂声学环境专门优化

实验室数据好看不等于真实可用。Hy ASR 3.0 preview 对高噪声、耳语、低音量三类场景做了专项优化,官方列出的可用环境包括地铁站、街道、工厂、KTV、咖啡厅和办公室。这几处几乎覆盖了日常可能遇到的典型噪声类型:交通低频轰鸣、人流嘈杂、机器规律性噪声、背景音乐与混响。

环境类型 典型挑战 适用场景举例
地铁站/街道 低频轰鸣与人声混杂 移动场景语音输入、语音搜索
工厂 规律性机械噪声、远距离拾音 巡检记录、现场作业日志
KTV/咖啡厅 强背景音乐、混响 社交娱乐类语音交互
办公室 多人交叠说话、低音量 会议转写、访谈整理

技术底座:MoE 架构配 Hy3 基座

架构层面,Hy ASR 3.0 preview 采用MoE 混合专家架构,基座模型升级至 Hy3。语音侧使用腾讯混元自研的无监督语音 Encoder,并通过数千万小时级、多来源语音数据进行联合训练。后训练阶段围绕通用转写、上下文理解、专业词汇和复杂长尾场景做了 SFT 与多阶段强化学习。

无监督语音 Encoder 的价值在于绕开标注数据的瓶颈——高质量人工转写音频的成本极高,而原始语音数据量巨大。先用自监督方式从海量未标注语音里学出通用声学表示,再用相对少量的标注数据做对齐与后训练,是当前语音大模型的主流路线。

落地入口与适用场景

模型已首发接入腾讯元宝,用户可在元宝中通过语音输入体验方言识别、专业术语、同音词纠错及复杂环境识别能力,WorkBuddy 等腾讯产品也在陆续接入。

企业侧,模型通过腾讯云提供 API 服务,官方列出的目标场景包括:智能客服、会议转写、音视频字幕、内容理解、语音搜索和企业知识库。企业还可叠加热词注入,对特定品牌、产品及行业术语做定制增强。

常见问题

Hy ASR 3.0 preview 支持哪些方言?

官方披露覆盖粤语、吴语等十大方言片区以及二十余个二级小片区,同时支持普通话、英语和中文英文混说。

企业如何提升自家业务的识别准确率?

可通过腾讯元宝体验基础能力;企业侧通过腾讯云 API 接入,并结合热词注入,把品牌名、产品名、人名和业务术语加入词表,以提升垂直场景准确率。

和传统语音识别比,核心差别在哪?

传统方案主要依赖声学信号做逐字转写;Hy ASR 3.0 preview 结合上下文语义判断表达意图后再输出文字,主要解决同音词误判、专业术语错写和复杂环境下的识别错误。

小结

Hy ASR 3.0 preview 的核心升级,是让语音识别从”尽量听清用户说了什么”,进一步走向”结合上下文理解用户想表达什么”。3.34% 的普通话 WER 与 3.12% 的粤语 WER 说明难任务已经逼近简单任务的水平;而方言覆盖、术语与热词注入、复杂声学环境这三项,恰好对应真实业务中最常见的三类失败。对会议纪要、访谈转写、客服质检和方言语音输入等场景来说,语义感知能力的加入有望显著减少后处理工作量。