FireRedAudio 小红书 FireRed 推出的通用音频语言模型
FireRedAudio是什么
FireRedAudio 是小红书 FireRed 团队推出的通用音频语言模型,基于 9B 参数 Qwen3.5 自回归 LLM。模型理解与生成分别使用独立的连续表征通道(Audio Encoder 与 RedAE),再汇入共享 LLM 统一推理。模型同时支持 ASR、音频问答、长达1小时的录音理解、Zero-shot TTS、指令 TTS 及语音编辑,在 MMAU、MMSU、多语种 ASR 和 Instruct TTS 等评测中均取得领先表现。

FireRedAudio的主要功能
- 音频理解 :在 MMAU、MMSU 等综合音频问答评测中取得表内最佳成绩,覆盖语音、音乐与环境声理解。
- 多语种 ASR :支持 102 种语言识别,FLEURS-102 平均错误率 14.94%,低资源语种表现尤为突出。
- Zero-shot TTS :给定任意参考语音即可合成新内容,中英文内容准确率表内领先。
- Instruct TTS :遵循用更慢的语速朗读等自然语言指令,六项评测指标全部领跑。
- 语音编辑 :支持语义层面的删除/插入/替换,以及声学层面的变速/变调/变音量。
- 长音频处理 :支持最长 1 小时录音,能生成秒级精度的时间线结构化摘要。
FireRedAudio的技术原理
- 解耦连续表征 :FireRedAudio 的不强迫理解与生成共享同一种音频表示,为两者分别设计独立的连续向量通道:理解侧需要紧凑语义特征以支持长上下文建模,生成侧需要可重建的精细声学特征以保留音色与韵律,两者在共享 LLM 中完成统一推理。
- 理解路径 :音频由 Whisper-large-v3 初始化的 Audio Encoder 编码,经 Adapter 压缩为每秒 12.5 个连续表征后输入 9B LLM,直接输出识别文本或理解答案,适配 ASR、音频问答与长音频结构化任务。
- 生成路径 :条件音频先经 RedAE(确定性自编码器)压缩为 25Hz、64 维连续 latent,预训练时通过冻结教师编码器进行语义蒸馏以保留内容线索;由 Patch Encoder 每 4 帧聚合成一个 audio step(6.25Hz)送入 LLM;LLM 每预测一个 audio-step token,以其隐藏状态驱动 flow-matching DiT 生成新 latent,最终由 RedAE Decoder 还原为 24kHz 波形。
- 五阶段渐进训练 :训练依次完成 Adapter 对齐、Audio Encoder 适配、理解与生成联合训练、多任务后训练、以及 200k 长上下文扩展,累计约 2.66T 非填充多模态 token,逐步叠加能力而非一次性混合所有任务。
- 共享推理中枢 :9B Qwen3.5 自回归 LLM 作为唯一可训练主干,负责跨模态推理、任务规划与上下文建模;理解与生成仅在输入表征层解耦,在推理层统一,使模型既能听懂又能开口而不牺牲各侧的信息保真度。

如何使用FireRedAudio
- 环境配置 :从 GitHub 仓库阅读环境与依赖安装说明,准备好运行环境。
- 获取权重 :从 Hugging Face 官方页面下载模型权重与配置文件。
- 跑通样例 :先执行官方提供的最小推理样例,验证模型版本、音频采样率与输出路径。
- 验证理解 :分别测试 ASR 和音频问答功能,确认理解路径正常工作。
- 验证生成 :分别测试 Zero-shot TTS 和指令 TTS,确认生成路径正常工作。
- 音频格式 :生成任务中保持输入输出为 24 kHz 采样率,并记录 DiT 采样步数与显存峰值。
- TTS 设置 :Zero-shot TTS 时,用参考语音的最后两个 audio step 初始化声学历史,其他生成任务使用零初始化。
- 硬件评估 :根据 9B 主干权重、KV cache 及 DiT 采样开销评估显存需求,长音频任务需额外预留上下文缓存空间。
FireRedAudio的核心优势
- 统一架构 :一个 9B 自回归 LLM 同时承载音频理解与生成,避免多模块拼接带来的能力分散。
- 解耦表征 :理解与生成分别使用最适合自身的连续表征通道,既保留语义紧凑性又不丢失声学细节。
- 性能领先 :在 MMAU、MMSU、102 语种 ASR 及 Instruct TTS 六项指标上均取得表内最佳成绩。
- 长音频支持 :通过 200k 上下文扩展,可处理最长 1 小时录音并输出秒级精度结构化时间线。
- 全栈覆盖 :单模型支持 ASR、音频问答、Zero-shot TTS、指令 TTS、语义/声学语音编辑六大任务。
FireRedAudio的项目地址
- GitHub仓库 :https://github.com/FireRedTeam/FireRedAudio
- HuggingFace模型库 :https://huggingface.co/FireRedTeam/FireRedAudio
- arXiv技术论文 :https://arxiv.org/pdf/2608.24168
FireRedAudio的同类竞品对比
对比维度 | FireRedAudio | Qwen3.5-Omni-Plus
| 对比维度 | FireRedAudio | Qwen3.5-Omni-Plus |
|---|---|---|
| 定位 | 专注音频领域的通用理解与生成模型 | 覆盖文本/图像/音频/视频的全模态通用模型 |
| 架构 | 9B 自回归 LLM + 解耦连续表征(Audio Encoder / RedAE) | 更大规模端到端多模态架构,所有模态统一处理 |
| 理解评测 | MMAU test 80.9、MMSU 83.3,均为表内最佳 | MMAU test 79.9、MMSU 80.7,略低于 FireRedAudio |
| 多语种 ASR | FLEURS-102 平均 WER 14.94%,低资源语种优势显著 | FLEURS-102 平均 WER 23.66%,多语种覆盖稍弱 |
| 生成能力 | 支持 Zero-shot TTS、Instruct TTS、语音编辑,DiT 输出 24kHz 波形 | 支持语音合成与理解,但不侧重语音编辑与细粒度声学控制 |
| 长音频 | 200k 上下文支持 1 小时录音,strict@0 通过率 73.6% | 具备长音频处理能力,但论文中未展示同量级 1 小时结构化评测 |
FireRedAudio的应用场景
- 智能会议助理 :将 1 小时会议录音自动转写为带秒级时间戳的结构化纪要,并提取关键决策与待办事项。
- 多语种内容本地化 :输入中文视频,自动识别原声并生成英语、日语等多语种配音,保持原说话人音色与情感风格。
- 播客/有声书后期制作 :通过自然语言指令调整语速、音量或替换特定语句,无需重新录制即可完成语音编辑。
- 智能客服语音交互 :实时理解用户语音咨询(含环境噪音与口音),并以指定音色、语速生成回复语音,实现端到端语音对话。
- 音频内容审核与检索 :对长音频平台的海量内容做结构化理解,支持找出所有提到价格欺诈的片段等语义级检索与标注。
相关工具
与本文相关的 AI 工具