如果你还在为「语音识别用一个模型、语音合成换另一个模型、音频理解再接第三个模型」的拼装方案头疼,小红书 FireRed 团队给出的答案是一个模型全包:FireRedAudio 通用音频语言模型。它基于 9B 参数的 Qwen3.5 架构,采用解耦连续表征设计,一次性覆盖 ASR、音频问答、1 小时长音频理解、Zero-shot TTS、指令 TTS 与语音编辑六类任务,在 MMAU、MMSU、102 语种 ASR 与 Instruct TTS 等评测中取得领先成绩,FLEURS-102 平均错误率仅 14.94%。换句话说,音频领域的「语言模型统一一切」路线,第一次有了一个参数量不大、任务覆盖却异常完整的落地样本。
为什么「通用音频语言模型」这件事难
文本大模型能统一任务,是因为文字天然是离散符号,可以直接进 Transformer。音频不行——原始波形是高密度连续信号,一段十秒语音的采样点数量远超同等语义的文本 token 数,直接塞进语言模型会让序列长度爆炸,训练和推理成本都不可接受。
过去工业界的主流解法是任务专用模型堆叠:ASR 用一套编码器-解码器,TTS 用另一套声学模型加声码器,音频理解再单独训练一个分类或检索模型。这套做法效果好,但问题也很明显:
- 每新增一个任务就要重训一套模型,研发与维护成本线性上升;
- 跨任务能力无法复用,模型「听得懂」不代表「说得出」;
- 多模型串联带来误差累积,ASR 转写错一个词,下游理解就跟着偏。
通用音频语言模型的目标,就是让同一个骨干网络既能「读」音频也能「写」音频,把听与说放进同一套表征空间。
技术架构:9B 参数 Qwen3.5 基座 + 解耦连续表征
解耦连续表征解决的是什么问题
FireRedAudio 的关键设计是解耦连续表征(decoupled continuous representation)。所谓「连续」,指音频不再被强行量化成离散 token 再喂给语言模型,而是保留连续向量,避免量化过程损失音色、韵律和细微的声学细节;所谓「解耦」,指把音频中不同性质的信息拆开处理——语义内容、说话人身份、韵律节奏、环境声学条件被分到不同的表征通道。
这样做有两个直接好处:一是连续表征保住了 TTS 与语音编辑最需要的音质保真度,二是解耦让「换一个说话人但保留原内容和韵律」「改一段话但保留原音色」这类精细化编辑成为可能,而不需要重新生成整段音频。
为什么 9B 是一个务实的选择
9B 参数规模处在「能力足够,部署可控」的区间。相比动辄 70B 以上的通用大模型,9B 模型在单卡或少量卡的推理集群上就能跑起来,端到端延迟更容易压到实时交互可接受的范围内;而依托 Qwen3.5 这一经过大规模文本与多模态预训练的基座,它又天然具备指令跟随与语义推理能力,不必从零学习语言结构。对需要在真实产品中调用音频能力的团队来说,这个量级比「参数越大越好」更有工程意义。
六大任务一览:从听懂到说出再到改写
| 任务 | 能力说明 | 典型场景 |
|---|---|---|
| ASR 语音识别 | 把语音转写为文本,覆盖 102 语种 | 会议纪要、字幕生成、客服质检 |
| 音频问答 | 基于音频内容回答提问,而非先转写再问答 | 播客检索、访谈内容抽取、庭审记录查询 |
| 1 小时长音频理解 | 对超长音频做整体语义把握与结构化摘要 | 课程复盘、长会议归因、播客章节化 |
| Zero-shot TTS | 不给参考音频也能生成指定内容的语音 | 有声书批量生产、导航播报 |
| 指令 TTS | 按自然语言指令控制语气、情绪、节奏与风格 | 广告配音、角色对话、品牌语音形象 |
| 语音编辑 | 在保留音色与语境的前提下改写局部内容 | 已录制内容纠错、口播稿微调 |
真正值得注意的是1 小时长音频理解与语音编辑这两项。前者意味着模型不再只能处理几十秒的短片段,而是能对一整场会议、一期播客做全局推理;后者把「改一句话」从「整段重录」变成了「局部重生成」,这对内容生产流程的改造是实质性的。
评测表现:14.94% 意味着什么
官方披露的成绩中,最有参考价值的是 FLEURS-102 平均错误率 14.94%。FLEURS 是覆盖 102 个语种的多语种语音评测集,语种覆盖广、口音与录音条件差异大,一直被当作多语种语音模型的硬指标。在 102 语种的平均口径下把错误率压到 15% 以内,说明模型并非只在中英文等高资源语种上表现好,低资源语种的泛化能力同样在线。
除 FLEURS 外,模型在 MMAU(音频理解)、MMSU(语音理解)与 Instruct TTS 等评测中也取得领先成绩。这几项分别对应「听懂」「跨语种理解」和「按指令说出」三类能力,合在一起看,说明统一架构并没有因为任务多而在单项上明显掉队——这正是过去多任务模型最容易被诟病的地方。
FireRed 团队的路线:从 TTS 基座走向通用音频
FireRedAudio 并非孤立出现。同一团队在语音合成方向已有持续积累,此前开源过统一语音生成与编辑模型 FireRedTTS3,支持 24 种语言与 21 种中文方言的零样本音色克隆、自然语言声音设计与指定区域精准语音编辑;也开源过语音合成基座模型 dots.tts。从专用 TTS 基座,到统一的语音生成与编辑,再到今天覆盖理解与生成的通用音频语言模型,这条路线是先在一类任务上把表征打通,再向全任务扩展,比一开始就追求大而全更稳妥。
落地建议:什么场景该考虑它,什么场景先别急
适合优先考虑的场景:需要同时做识别与合成的产品(如智能客服、语音助手)、多语种内容平台、长音频内容的结构化处理,以及对音频做精细化后期编辑的 workflow。
暂时不必替换现有方案的场景:对延迟极其苛刻的实时同传链路,以及对单一任务精度要求极高的垂类(如医疗听写),专用模型在单点上仍可能更稳。工程上更现实的做法是先做影子测试——让统一模型与现有专用模型并行跑一段时间,在同一批真实音频上比较错误率、延迟与成本,再决定是否切换。
FAQ
FireRedAudio 与普通语音识别模型有什么本质区别?
普通 ASR 模型只做「语音转文字」这一件事,输入输出都是单向的。FireRedAudio 把音频的「理解」和「生成」放进同一个模型:既能把音频转成文字,也能根据文字或指令生成音频,还能对已有音频做局部编辑,六类任务共用一套骨干网络与表征空间。
9B 参数对部署硬件的要求高吗?
相比 70B 级别的通用大模型,9B 规模在显存占用和推理延迟上压力小得多,属于中小团队也能评估与试用的量级。具体显存需求取决于量化方案与并发量,实际部署前建议以官方当期给出的推理配置为准,并在自有音频样本上做一次端到端压测。
「解耦连续表征」对最终效果的实际影响是什么?
主要体现在两点:一是避免离散量化带来的音质损失,让合成与编辑后的音频更自然;二是把内容、音色、韵律拆到不同通道,使得「换说话人保留内容」「改内容保留音色」这类操作可控,而不必整段重新生成。
小结
FireRedAudio 的价值不在于某一个单项指标刷到第一,而在于它验证了音频领域的任务统一是可行的:9B 参数、单一架构、六个任务、102 语种,FLEURS-102 平均错误率 14.94%。对开发者而言,这意味着音频能力的接入方式可能从「拼装多个专用模型」转向「调用一个统一模型」;对行业而言,这是继文本之后,又一个模态走向通用化的信号。当然,统一架构能否在极端垂类和超低延迟场景真正替代专用模型,还需要更多真实业务的检验。
相关阅读
这条线上还有几篇站内文章可以接着看:
- 小红书 FireRedTTS3 开源:统一语音生成与编辑,24 语种 21 种中文方言零样本克隆
- Kaldi之父在小米憋了什么大招?OmniVoice背后的语音AI野心
- Kimi-Audio 开源音频大模型解析:LibriSpeech 词错误率 1.28%,三段式架构统一语音任务
延伸阅读
- B站开源 IndexTTS-2.5:0.8B 参数零样本语音克隆,推理提速 2.28 倍、实时率降至 0.202 天前
- 中国电信开源 Xing4.0-29B-A4B:全栈国产,消费级显卡跑 512K 上下文3 天前
- 腾讯开源 EVIE-Preview-4.5B:不用 OCR 的文档检索,4.5B 参数拿了 ViDoRe 第一3 周前
- StepAudio 3 系列发布:五款语音模型,Realtime 98.9 分登顶、ASR 词错率 1.7%3 天前
