英伟达把 1 亿参数的语音分割模型免费放出来了
9 月 27 日,英伟达发布 Nemotron3Diarization,一个约 1 亿参数的语音分割聚类模型,权重开放、可免费使用。它要解决的问题很具体,一段多人对话音频里,任意时刻到底是谁在说话。
规模小是这个模型的重点。1 亿参数意味着单张消费级显卡就能跑起来,不需要为它单独准备一整套推理集群。英伟达把它做成可嵌入的组件,而不是又一个需要排队调用的云服务。
VoiceArena 上 14.72% 的错误率是什么水平
语音分割领域通用的硬指标是 DER(Diarization Error Rate),数值越低越好。在 VoiceArena 语音分割基准 v1 版本上,Nemotron3Diarization 拿到 14.72%,排名第一,第二名是 19.3%,两者相差 4.58 个百分点。在这个量级上,差距肉眼可辨。
和自家前代 Streaming Sortformer 相比,在使用 1.04 秒音频缓冲区的八个测试场景里,平均错误率降低了 41%。
0.32 秒到 30.4 秒,缓冲区自己调
实时场景和离线转写在延迟容忍度上完全是两回事。会议直播希望结果越快越好,录播整理则愿意多等一会儿换准确率。新模型给了四级动态音频缓冲区,范围从 0.32 秒到 30.4 秒。
缓冲区越小延迟越低,但模型判断说话人切换的依据也越少,重叠语音上更容易出错;缓冲区越大越稳,代价是首字结果要等更久。把选择权交给部署方,比替所有人定死一个档位更实用。
最多 8 人同时发声,接上 Parakeet 直接出带标签文本
模型支持最多 8 人同时发声的实时与录音音频处理,输出可以和英伟达自家的 Parakeet 等语音识别系统无缝协同,识别结果自动带上匿名说话人标签,形如 speaker_2,人工标注这一步就可以省掉。和 Qwen-Audio-3.1 那种一条龙打包的语音模型不同,它只专心做切分这一件事。
边界也要说清楚,参与人数越多、背景噪声越大、混响越重,错误率会跟着上升。重叠语音一直是这个任务的传统难点,新架构缓解了问题,但没有把它变成已解决的问题。
哪些场景真的能用上
| 场景 | 以前的痛点 | Nemotron3Diarization 的变化 |
|---|---|---|
| 多人会议记录 | 转写完还要人工分角色 | 8 人以内自动打说话人标签 |
| 客服通话质检 | 坐席与客户发言难以切分 | 实时切分,缓冲区可调 |
| 访谈与播客整理 | 离线处理耗时长 | 1 亿参数本地即可跑 |
| 多角色语音交互 | 需要区分说话人才能响应 | 支持实时音频流输入 |
对做实时字幕和会议产品的人来说,这类轻量模型补齐的是讯飞 Spark-ASR-2.0这类识别模型不太管的一层,识别负责把声音转成字,分割负责说清这句字是谁的。国内厂商在识别侧已经卷得很厉害,Kimi-Audio 和 FireRedAudio 走的是通用音频大模型路线,英伟达这次是反过来做小做专。
小结
1 亿参数、免费、开放权重、DER 14.72% 登顶,四个点凑在一起,说明语音分割这个细分任务的高精度门槛被拉低了不少。它不会成为头条级别的新闻,但对需要在产品里嵌多说话人识别的团队来说,是个省事的新选项。
相关阅读
- Qwen-Audio-3.1 发布:五款语音模型齐发,ASR 降价 95%
- 讯飞发布 Spark-ASR-2.0:9 月 24 日起上线输入法,同步开放 API
- Kimi-Audio 开源音频大模型解析:LibriSpeech 词错误率 1.28%
- 小红书 FireRedAudio 通用音频语言模型:9B 参数统一六大音频任务
- 英伟达开源自动驾驶推理模型 Alpamayo 2 Super
延伸阅读
- 腾讯混元 Hy4 preview 轻量版开源:1.5TB 压到 214GB,4090 笔记本跑起来了4 周前
- 阿里发布 Qwen3.8-Flash:每 Token 仅激活 6B 参数,训练成本降至 Qwen3.7-Plus 的 1/91 周前
- 阿里通义 Wan2.2 开源视频生成模型解析:MoE 架构还原电影镜头语言,Apache 2.0 开放权重7 天前
- MiniMax-M1 开源推理模型解析:4560 亿参数、100 万 Token 上下文,54 万美元完成训练1 周前
