英伟达 Nemotron3 语音分割模型开源:1亿参数,DER 14.72% 登顶

英伟达把 1 亿参数的语音分割模型免费放出来了

9 月 27 日,英伟达发布 Nemotron3Diarization,一个约 1 亿参数的语音分割聚类模型,权重开放、可免费使用。它要解决的问题很具体,一段多人对话音频里,任意时刻到底是谁在说话。

规模小是这个模型的重点。1 亿参数意味着单张消费级显卡就能跑起来,不需要为它单独准备一整套推理集群。英伟达把它做成可嵌入的组件,而不是又一个需要排队调用的云服务。

VoiceArena 上 14.72% 的错误率是什么水平

语音分割领域通用的硬指标是 DER(Diarization Error Rate),数值越低越好。在 VoiceArena 语音分割基准 v1 版本上,Nemotron3Diarization 拿到 14.72%,排名第一,第二名是 19.3%,两者相差 4.58 个百分点。在这个量级上,差距肉眼可辨。

和自家前代 Streaming Sortformer 相比,在使用 1.04 秒音频缓冲区的八个测试场景里,平均错误率降低了 41%。

0.32 秒到 30.4 秒,缓冲区自己调

实时场景和离线转写在延迟容忍度上完全是两回事。会议直播希望结果越快越好,录播整理则愿意多等一会儿换准确率。新模型给了四级动态音频缓冲区,范围从 0.32 秒到 30.4 秒。

缓冲区越小延迟越低,但模型判断说话人切换的依据也越少,重叠语音上更容易出错;缓冲区越大越稳,代价是首字结果要等更久。把选择权交给部署方,比替所有人定死一个档位更实用。

最多 8 人同时发声,接上 Parakeet 直接出带标签文本

模型支持最多 8 人同时发声的实时与录音音频处理,输出可以和英伟达自家的 Parakeet 等语音识别系统无缝协同,识别结果自动带上匿名说话人标签,形如 speaker_2,人工标注这一步就可以省掉。和 Qwen-Audio-3.1 那种一条龙打包的语音模型不同,它只专心做切分这一件事。

边界也要说清楚,参与人数越多、背景噪声越大、混响越重,错误率会跟着上升。重叠语音一直是这个任务的传统难点,新架构缓解了问题,但没有把它变成已解决的问题。

哪些场景真的能用上

场景 以前的痛点 Nemotron3Diarization 的变化
多人会议记录 转写完还要人工分角色 8 人以内自动打说话人标签
客服通话质检 坐席与客户发言难以切分 实时切分,缓冲区可调
访谈与播客整理 离线处理耗时长 1 亿参数本地即可跑
多角色语音交互 需要区分说话人才能响应 支持实时音频流输入

对做实时字幕和会议产品的人来说,这类轻量模型补齐的是讯飞 Spark-ASR-2.0这类识别模型不太管的一层,识别负责把声音转成字,分割负责说清这句字是谁的。国内厂商在识别侧已经卷得很厉害,Kimi-Audio 和 FireRedAudio 走的是通用音频大模型路线,英伟达这次是反过来做小做专。

小结

1 亿参数、免费、开放权重、DER 14.72% 登顶,四个点凑在一起,说明语音分割这个细分任务的高精度门槛被拉低了不少。它不会成为头条级别的新闻,但对需要在产品里嵌多说话人识别的团队来说,是个省事的新选项。

相关阅读