结论先行:科大讯飞推出全国产语音基座大模型 Spark-Audio-1.0-Preview。它基于纯国产算力训练,采用 0.65B 音频编码器 + 30B-A3B MoE 语言模型,用 1300 万小时音频数据训练,能直接理解语音的语义、情绪与场景,支持 99 种语言、202 种方言识别,并在高噪声、小音量等复杂场景下表现领先,Fleurs 中文集取得 SOTA。
一、模型结构:小编码器配大模型
Spark-Audio 的分工很清晰:0.65B 的音频编码器负责把声音转成紧致的语义表征,30B 参数、激活约 3B 的 MoE(混合专家)语言模型负责理解与生成。这种”小前端 + 大后端”的组合,既能压住音频侧的算力开销,又给语义理解留出足够容量,是当下语音基座模型常见的工程取舍。
二、它强在哪
| 指标 | Spark-Audio-1.0-Preview |
|---|---|
| 训练算力 | 纯国产算力 |
| 音频数据 | 1300 万小时 |
| 语言 / 方言 | 99 种语言、202 种方言 |
| 复杂场景 | 高噪声、小音量领先 |
| 基准 | Fleurs 中文集 SOTA |
值得强调的是”直接理解语义、情绪与场景”——它不只是做语音识别(ASR),而是把情感与语境一并建模,这对客服、陪伴、车载等需要”听懂人”的场景更关键。202 种方言的覆盖,也切中中文 multilingual 的现实需求。
三、为什么”全国产”值得单列
从编码器、语言模型到训练算力全链路国产,意味着它在供应链与合规上更可控,适合对自主可控有要求的政企与行业客户。对中文语音赛道来说,一个能在方言和噪声场景里打 SOTA 的国产基座,本身就是生态级的基础设施。
常见问题(FAQ)
Q1:Spark-Audio 和普通语音识别有什么不同?
A1:普通识别只转文字,Spark-Audio 作为语音基座模型,同时理解语义、情绪与场景,能力更接近”听懂”而非”听写”。
Q2:30B-A3B 里的 A3B 是什么意思?
A2:A3B 表示总参数约 30B、每次激活约 3B 的 MoE(混合专家)结构,用稀疏激活在控成本的同时保住大模型能力。
Q3:202 种方言识别有什么用?
A3:覆盖大量地方口音,让模型在真实多元的中文环境里更稳健,尤其利于下沉市场与方言区的语音交互产品。
小结
Spark-Audio-1.0-Preview 把”全国产 + 语音基座 + 方言/噪声鲁棒”三件事拧在一起,给中文语音应用补了一块自主可控的地基。后续若开放 API,值得在客服、车载、陪伴等场景实测。
