FireRedTTS3 小红书开源的统一语音生成与编辑模型
FireRedTTS3是什么
FireRedTTS3 是小红书 FireRed 团队开源的统一语音生成与编辑模型。模型基于 RedAE 语义增强连续表示与 LLM-DiT 架构,单一模型可实现24 种语言 + 21 种中文方言的零样本音色克隆、自然语言描述的声音设计,以及指定区域的精准语音编辑。模型在四个公开评测集上均取得最优结果,已全面开源可本地部署。

FireRedTTS3的主要功能
- 零样本音色克隆 :给定几秒参考音频,即可用该音色合成 24 种语言及 21 种中文方言的语音。
- 声音设计 :通过自然语言描述即可生成此前不存在的全新音色,无需参考音频。
- 语音编辑 :对已有语音的指定区域进行精准修改,包括改词、调速、变调、调音量,其余部分保持不变。
FireRedTTS3的技术原理
- RedAE 语义增强连续表示 :在 tokenizer 训练阶段引入语义教师模型进行特征蒸馏,将语义信息注入连续 latent,既保留声学细节又缓解自回归误差累积,无需额外语义模块或多阶段训练。
- LLM-DiT 生成框架 :以 Qwen3-1.7B 为 Backbone 继承文本理解与指令跟随能力,通过 Aggregator 压缩序列后自回归建模,再由 DiT 模块在 Backbone 条件下做 patch 级去噪生成,保持时间连贯性。
- 先规划再合成(Instruct 版) :将自然语言指令解析为结构化声学方案或编辑掩码,再映射到 RedAE 表示进行合成,实现对声音设计和语音编辑的精准控制,不破坏未指定区域。
如何使用FireRedTTS3
- 环境准备 :克隆 GitHub 仓库并安装 requirements.txt 中的依赖。
- 模型下载 :通过 ModelScope 下载 FireRedTeam/FireRedTTS3 预训练模型到本地目录。
- 语种识别(可选) :下载 FastText 语言识别模型,让 Base 版自动判断输入文本的语种。
- 零样本克隆 :加载 Base 版模型,传入参考音频、参考文本和目标文本即可生成对应音色语音。
- 声音设计 :调用 Instruct 版的 generate_voice_design ,仅传入自然语言描述和目标文本即可生成全新音色。
- 语义编辑 :调用 generate_semantic_edit ,用自然语言指令指定插入、删除或替换内容,修改指定区域。
- 声学编辑 :调用 generate_acoustic_edit ,使用固定模板指令(如 adjust the speed to 0.5x )调整语速、音高或音量。
- 方言合成 :传入带 ZH_ 前缀的方言标签(如 ZH_Sichuan ),并尽量使用同方言参考音频以获得最佳效果。
FireRedTTS3的核心优势
- 三任务统一建模 :将音色克隆、声音设计、语音编辑整合到单一模型,无需为不同任务分别训练或切换模型,降低系统复杂度。
- RedAE 语义增强连续表示 :在 tokenizer 训练阶段即注入语义信息,既避免了离散 token 的声学细节损失,又缓解了连续自回归的误差累积,兼顾音质与稳定性。
- 顶尖的多语言/方言能力 :支持 24 种语言与 21 种中文方言的零样本克隆,在 MiniMax-MLS-Test 的 24 语种评测中 22 个语言位列前二。
- 四个公开榜单全面领先 :在 Seed-TTS-Eval、MiniMax-MLS-Test、InstructTTSEval、Ming-Freeform-Audio-Edit 上,字错率与说话人相似度均取得最优或次优成绩。
- 精准可控的先规划、再合成: Instruct 版将自然语言指令解析为结构化声学方案后再渲染,确保编辑只影响指定区域,其余内容和音色保持不变。
FireRedTTS3的项目地址
- GitHub仓库 :https://github.com/FireRedTeam/FireRedTTS3
- HuggingFace模型库 :https://modelscope.cn/models/FireRedTeam/FireRedTTS3
FireRedTTS3的同类竞品对比
对比维度 | FireRedTTS3 | CosyVoice3
>| 对比维度 | FireRedTTS3 | CosyVoice3 |
|---|---|---|
| 开发团队 | 小红书 FireRed 团队 | 阿里通义实验室 |
| 开源状态 | 模型 + 代码 + Demo 全面开源 | 部分版本开源 |
| 核心能力 | 克隆 / 设计 / 编辑 统一建模 | 侧重语音克隆与指令控制 |
| 语言与方言 | 24 种语言 + 21 种中文方言 | 多语言支持,方言覆盖较少 |
| 技术路线 | RedAE 连续表示 + LLM-DiT | 离散 Token + Flow Matching |
| 零样本克隆 | Seed-TTS-Eval 相似度 78.8% | Seed-TTS-Eval 相似度 75.3% |
| 声音设计 | 自然语言描述生成全新音色 | 主要支持风格 / 情感控制 |
| 语音编辑 | 支持精准局部编辑(改词/调速/变调) | 编辑能力有限,非核心功能 |
| 推理部署 | 支持本地 GPU 部署,提供完整 API | 支持本地部署 |
FireRedTTS3的应用场景
- 多语言有声内容制作 :用几秒参考音频克隆音色,快速生成 24 种语言的有声书或播客,无需聘请多语种配音员。
- 游戏与虚拟角色配音 :通过自然语言描述设计专属角色音色,或精准编辑已有台词中的个别字词,避免整句重录。
- 视频与播客后期剪辑 :在成品语音中直接替换错误词汇、调整语速或删除冗余片段,无需回到录音棚重新录制。
- 品牌智能客服 :零样本克隆企业专属客服音色,保持一致的品牌声音形象,同时支持多语言服务。
- 方言内容创作 :用 21 种中文方言合成本地化内容,如方言短视频、地方文化节目,大幅降低方言配音门槛。
相关工具
与本文相关的 AI 工具