首页/ 资讯/ FireRedAudio 小红书 FireRed 推出的通用音频语言模型

FireRedAudio 小红书 FireRed 推出的通用音频语言模型

灵犀编辑部 2026-09-01 0 阅读

FireRedAudio是什么

FireRedAudio 是小红书 FireRed 团队推出的通用音频语言模型,基于 9B 参数 Qwen3.5 自回归 LLM。模型理解与生成分别使用独立的连续表征通道(Audio Encoder 与 RedAE),再汇入共享 LLM 统一推理。模型同时支持 ASR、音频问答、长达1小时的录音理解、Zero-shot TTS、指令 TTS 及语音编辑,在 MMAU、MMSU、多语种 ASR 和 Instruct TTS 等评测中均取得领先表现。

FireRedAudio

FireRedAudio的主要功能

  • 音频理解 :在 MMAU、MMSU 等综合音频问答评测中取得表内最佳成绩,覆盖语音、音乐与环境声理解。
  • 多语种 ASR :支持 102 种语言识别,FLEURS-102 平均错误率 14.94%,低资源语种表现尤为突出。
  • Zero-shot TTS :给定任意参考语音即可合成新内容,中英文内容准确率表内领先。
  • Instruct TTS :遵循用更慢的语速朗读等自然语言指令,六项评测指标全部领跑。
  • 语音编辑 :支持语义层面的删除/插入/替换,以及声学层面的变速/变调/变音量。
  • 长音频处理 :支持最长 1 小时录音,能生成秒级精度的时间线结构化摘要。

FireRedAudio的技术原理

  • 解耦连续表征 :FireRedAudio 的不强迫理解与生成共享同一种音频表示,为两者分别设计独立的连续向量通道:理解侧需要紧凑语义特征以支持长上下文建模,生成侧需要可重建的精细声学特征以保留音色与韵律,两者在共享 LLM 中完成统一推理。
  • 理解路径 :音频由 Whisper-large-v3 初始化的 Audio Encoder 编码,经 Adapter 压缩为每秒 12.5 个连续表征后输入 9B LLM,直接输出识别文本或理解答案,适配 ASR、音频问答与长音频结构化任务。
  • 生成路径 :条件音频先经 RedAE(确定性自编码器)压缩为 25Hz、64 维连续 latent,预训练时通过冻结教师编码器进行语义蒸馏以保留内容线索;由 Patch Encoder 每 4 帧聚合成一个 audio step(6.25Hz)送入 LLM;LLM 每预测一个 audio-step token,以其隐藏状态驱动 flow-matching DiT 生成新 latent,最终由 RedAE Decoder 还原为 24kHz 波形。
  • 五阶段渐进训练 :训练依次完成 Adapter 对齐、Audio Encoder 适配、理解与生成联合训练、多任务后训练、以及 200k 长上下文扩展,累计约 2.66T 非填充多模态 token,逐步叠加能力而非一次性混合所有任务。
  • 共享推理中枢 :9B Qwen3.5 自回归 LLM 作为唯一可训练主干,负责跨模态推理、任务规划与上下文建模;理解与生成仅在输入表征层解耦,在推理层统一,使模型既能听懂又能开口而不牺牲各侧的信息保真度。
挖挖GitHub

如何使用FireRedAudio

  • 环境配置 :从 GitHub 仓库阅读环境与依赖安装说明,准备好运行环境。
  • 获取权重 :从 Hugging Face 官方页面下载模型权重与配置文件。
  • 跑通样例 :先执行官方提供的最小推理样例,验证模型版本、音频采样率与输出路径。
  • 验证理解 :分别测试 ASR 和音频问答功能,确认理解路径正常工作。
  • 验证生成 :分别测试 Zero-shot TTS 和指令 TTS,确认生成路径正常工作。
  • 音频格式 :生成任务中保持输入输出为 24 kHz 采样率,并记录 DiT 采样步数与显存峰值。
  • TTS 设置 :Zero-shot TTS 时,用参考语音的最后两个 audio step 初始化声学历史,其他生成任务使用零初始化。
  • 硬件评估 :根据 9B 主干权重、KV cache 及 DiT 采样开销评估显存需求,长音频任务需额外预留上下文缓存空间。

FireRedAudio的核心优势

  • 统一架构 :一个 9B 自回归 LLM 同时承载音频理解与生成,避免多模块拼接带来的能力分散。
  • 解耦表征 :理解与生成分别使用最适合自身的连续表征通道,既保留语义紧凑性又不丢失声学细节。
  • 性能领先 :在 MMAU、MMSU、102 语种 ASR 及 Instruct TTS 六项指标上均取得表内最佳成绩。
  • 长音频支持 :通过 200k 上下文扩展,可处理最长 1 小时录音并输出秒级精度结构化时间线。
  • 全栈覆盖 :单模型支持 ASR、音频问答、Zero-shot TTS、指令 TTS、语义/声学语音编辑六大任务。

FireRedAudio的项目地址

  • GitHub仓库 :https://github.com/FireRedTeam/FireRedAudio
  • HuggingFace模型库 :https://huggingface.co/FireRedTeam/FireRedAudio
  • arXiv技术论文 :https://arxiv.org/pdf/2608.24168

FireRedAudio的同类竞品对比

对比维度 | FireRedAudio | Qwen3.5-Omni-Plus

>
对比维度 FireRedAudio Qwen3.5-Omni-Plus
定位 专注音频领域的通用理解与生成模型 覆盖文本/图像/音频/视频的全模态通用模型
架构 9B 自回归 LLM + 解耦连续表征(Audio Encoder / RedAE) 更大规模端到端多模态架构,所有模态统一处理
理解评测 MMAU test 80.9、MMSU 83.3,均为表内最佳 MMAU test 79.9、MMSU 80.7,略低于 FireRedAudio
多语种 ASR FLEURS-102 平均 WER 14.94%,低资源语种优势显著 FLEURS-102 平均 WER 23.66%,多语种覆盖稍弱
生成能力 支持 Zero-shot TTS、Instruct TTS、语音编辑,DiT 输出 24kHz 波形 支持语音合成与理解,但不侧重语音编辑与细粒度声学控制
长音频 200k 上下文支持 1 小时录音,strict@0 通过率 73.6% 具备长音频处理能力,但论文中未展示同量级 1 小时结构化评测

FireRedAudio的应用场景

  • 智能会议助理 :将 1 小时会议录音自动转写为带秒级时间戳的结构化纪要,并提取关键决策与待办事项。
  • 多语种内容本地化 :输入中文视频,自动识别原声并生成英语、日语等多语种配音,保持原说话人音色与情感风格。
  • 播客/有声书后期制作 :通过自然语言指令调整语速、音量或替换特定语句,无需重新录制即可完成语音编辑。
  • 智能客服语音交互 :实时理解用户语音咨询(含环境噪音与口音),并以指定音色、语速生成回复语音,实现端到端语音对话。
  • 音频内容审核与检索 :对长音频平台的海量内容做结构化理解,支持找出所有提到价格欺诈的片段等语义级检索与标注。
相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐