Fun-ASR-Realtime 升级:30 种语言 + 16 种方言实时识别,方言字符准确率 88.62%

结论先行:2026 年 7 月 6 日,阿里通义升级实时语音识别模型 Fun-ASR-Realtime,API 已上线阿里云百炼平台。该模型面向低延迟语音转文字场景,支持音频流式输入与文本流式输出,单模型覆盖 30 种语言与 16 种方言。公开信息显示,在覆盖八大方言区的 16 种方言识别测试中,其字符准确率平均为 88.62%。

实时语音识别的技术前提:WebSocket 与双流式

据阿里云百炼文档,实时语音识别基于 WebSocket 协议,适用于需要“边说边转写”的语音交互场景。Fun-ASR-Realtime 支持音频流式输入和文本流式输出,也就是不必等用户说完一整段,模型就可以边接收音频边吐出文字。

这一点决定了它和离线转写产品的分野:离线转写追求整体最优准确率,允许等待;实时识别追求的是“尽快给出可用结果”,延迟和准确率必须一起被优化。典型应用包括实时字幕、语音助手、会议转写、直播转写、客服通话和多语言语音输入。

覆盖范围:30 种语言与 16 种方言

Fun-ASR-Realtime 单模型支持 30 种语言与 16 种方言,重点覆盖多语言、地方方言和跨区域语音识别需求。据公开信息,在覆盖八大方言区的 16 种方言识别测试中,字符准确率平均为 88.62%。

中文语音识别真正的难点往往不在普通话,而在方言与口音。一个模型要同时处理 30 种语言和 16 种方言,意味着它必须在共享表示和多语言/多方言专有特征之间取得平衡,否则新增语种会拖累原有语种的表现。

首字延迟与流式准确率

在实时性方面,Fun-ASR-Realtime 的首字延迟可控制在百毫秒级别,流式识别准确率接近离线识别水平,同时支持多语言无缝切换。首字延迟是用户体感最敏感的指标——字幕晚半秒出现,观感就会明显断裂。

复杂场景的两个抓手:热词与上下文

复杂场景识别是此次升级的另一个重点。Fun-ASR-Realtime 支持热词增强和上下文理解,可在识别过程中动态注入品牌名、人名、地名、产品名、行业术语和对话上下文,用于改善同音词、专有名词和领域词的识别效果。阿里云百炼文档也将其标注为支持热词和方言的实时语音识别模型。

对真实业务来说,这一项的价值常被低估。通用模型在通用语料上表现良好,但一遇到公司名、产品型号、行业黑话就容易失手。热词增强本质上是给模型一张“当前场景的专有名词表”,让它在歧义处优先选择业务相关的候选。

接入方式与集成形态

接入方式 说明 适用端
WebSocket API 实时语音识别主通道,边说边转写 服务端、实时产品
DashScope SDK 提供 Java、Python SDK 后端服务集成
Fun-ASR 移动端 SDK 支持 Android 与 iOS SDK 移动端、智能硬件
阿里云百炼平台 模型调用与配置入口 开发者与企业团队

从产品定位看,Fun-ASR-Realtime 更适合被集成到应用和业务系统中,而不是作为单独的个人转写工具使用。它适合用于实时字幕、会议系统、客服质检、智能硬件、车载语音、教育直播、政务服务和出海业务等场景,尤其适合对低延迟、方言覆盖和行业词识别有要求的语音应用。

常见问题(FAQ)

Q:Fun-ASR-Realtime 的方言识别准确率是多少?

据公开信息,在覆盖八大方言区的 16 种方言识别测试中,其字符准确率平均为 88.62%,并在多类方言识别任务中取得较好表现。实际效果会受录音条件、口音程度和领域词汇影响。

Q:延迟能做到多少?

官方信息显示,其首字延迟可控制在百毫秒级别,流式识别准确率接近离线识别水平。实际端到端延迟还会叠加网络传输与前端采集耗时。

Q:开发者怎么接入?

可通过阿里云百炼平台调用 fun-asr-realtime。实时语音识别支持 WebSocket API,也支持 DashScope 的 Java、Python SDK;Fun-ASR 系列另支持 Android 和 iOS SDK,便于服务端、移动端与实时语音产品集成。

小结

Fun-ASR-Realtime 这次升级的重点,在于把实时性、多语言、方言识别和专业词增强这几件通常难以兼得的事放在同一个模型里。语音识别在真实业务中的难点,往往不只是“能不能转成文字”,还包括复杂口音、混合语种、行业术语、品牌名、人名和上下文语义消歧等细节。对需要实时字幕、会议转写、智能客服与出海业务语音能力的团队,它的价值主要体现在集成能力和场景适配度上。