科大讯飞在 9 月 23 日正式发布了新一代语音识别大模型 Spark-ASR-2.0。落地节奏给得很明确,9 月 24 日起在讯飞输入法逐步上线,同时通过讯飞开放平台向开发者和企业客户开放 API,之后陆续铺到讯飞 AI 眼镜、智能办公本、讯飞听见等自有软硬件上。
这次升级卡在哪个位置
要看懂 2.0 的意义,得先往前翻一周。9 月 16 日上线的 Spark-Audio-1.0-Preview 是讯飞的语音基座大模型,0.65B 编码器配 30B MoE,用全国产算力训练。它要解决的问题写在当时的介绍里。传统音频处理走级联方案,先把声音转成文字再交给语言模型理解,中间会丢掉语气、情绪和背景环境音;同时语音转写、声纹识别这些环节彼此割裂,场景判断很难完整。
Spark-ASR-2.0 站在识别这一侧。从命名看它是 ASR 线的第二次大版本迭代,重点是把识别能力往硬件和开放生态两头推。官方这次没有公布词错误率之类的量化指标,效果提升多少暂时只能等实测。
上线节奏与能用到的地方
| 时间 | 渠道 | 覆盖范围 |
|---|---|---|
| 9 月 24 日起 | 讯飞输入法 | 逐步上线 |
| 同期 | 讯飞开放平台 | 面向开发者与企业客户开放 API |
| 后续 | 讯飞 AI 眼镜、智能办公本、讯飞听见 | 深度落地 |
这个顺序值得留意。先上输入法,是因为输入法是把识别能力送到最多人嘴边的最短路径,每天产生海量真实语音,反过来又能继续喂模型。同期开放 API,是把生态位置先占住,让第三方硬件和行业方案不必自己从头训模型。
ASR 这条赛道现在有多挤
把时间轴拉长一点看,最近一个月语音模型的密度高得有点反常。千问在 9 月 23 日刚发了 Qwen-Audio-3.1,五款模型齐发,ASR 价格直接降了 95%,详细参数和定价在这篇 Qwen-Audio-3.1 发布 里。
腾讯混元这边有 Hy ASR 3.0 preview,普通话词错误率做到 3.34%,覆盖十大方言和中英混说,我们整理过 腾讯混元 Hy ASR 3.0 preview。终端侧还有千问输入法那套 300 字每分钟的语音输入方案,见 千问输入法上线。
讯飞自己的前一代是 讯飞 Spark-Audio-1.0-Preview,202 种方言识别,走的是全国产算力这条路。ASR 2.0 和它分属识别与基座两条线,公开信息里没有说明二者是否有直接继承关系。
常见问题
Spark-ASR-2.0 现在就能用到吗
官方说法是 9 月 24 日起在讯飞输入法逐步上线,逐步两个字意味着灰度,不是所有人同一天都能看到。开放平台的 API 同期提供,企业接入可以走开放平台申请。
和 Spark-Audio-1.0-Preview 是什么关系
一个是语音基座大模型,一个是语音识别模型,定位不同。2.0 是否直接构建在 1.0 Preview 之上,目前没有公开说明,这点我不确定,等官方技术报告。
第三方硬件厂商能用吗
可以通过讯飞开放平台的 API 接入。是否会有端侧或者私有化部署版本,目前没有公开信息。讯飞自家的眼镜和办公本属于内部落地,不等于对外开放。
小结
ASR 这条赛道的竞争点已经从准确率挪到了价格和生态位。讯飞这次的打法是自有的硬件线全铺一遍,配合开放平台把外部开发者接住,和千问那种直接把价格砍到一折的路子是两种思路。对开发者来说,短期内值得做的是把同一批测试音频在几个平台各跑一遍,看真实场景下的词错误率和并发成本,别只看官方口径。
相关阅读
延伸阅读
- Kimi 发布金融行业解决方案:9 项金融技能+5 项合规,受托报告 30 分钟缩至 10 分钟4 天前
- VAST 完成 B 轮与 B+ 轮共约 30 亿元融资:半年累计约 50 亿,Tripo P2.0 首发原生四边面拓扑3 天前
- 小米 MiMo-V2.6 RL 训练全程公开:单步 20 亿 Token,双版本训练成本破 128 万美元3 天前
- 宇树科技发布 UnifoLM-OminiA-0.3:单模型统筹家居康养,具身大模型进入“一站式”时代2 月前
