首页/ 资讯/ AuK 腾讯混元开源的语音生成与编辑基础模型

AuK 腾讯混元开源的语音生成与编辑基础模型

灵犀编辑部 2026-09-10 2 阅读

AuK是什么

AuK是腾讯混元开源的15亿参数语音生成与编辑基础模型,采用流匹配扩散架构而非自回归。模型能通过统一的自然语言指令接口完成16种语音任务,包括零样本/指令式TTS、语音内容编辑、声学调节、副语言编辑及降噪和人声分离等。模型提供4步推理的AuK-Flash快速版本,速度约提升4.5倍。

AuK

AuK的主要功能

  • Zero-shot TTS :用几秒参考音频克隆音色并合成新语音。
  • Instruct TTS :纯文字描述声音特征即可生成对应语音,无需参考音频。
  • 语音内容编辑 :在不改变音色语调的前提下替换、插入或删除录音中的文字。
  • 歌词编辑 :保留旋律与歌声特质,只改写歌词。
  • 音高/语速/音量编辑 :以半音、倍速、分贝为单位精确调节声学属性。
  • 情绪与音色编辑 :不换字改变情感色彩,或保留内容转换音色。
  • 口音编辑与去噪 :去除口音、降噪去混响,提升清晰度。
  • 副语言事件编辑 :添加或移除呼吸声、笑声、咳嗽,实现正常语音与耳语互转。
  • 语音分离 :按说话顺序拆分多人音频,或按内容描述提取目标说话人。
  • 音乐分离 :从歌曲中提取人声、去除伴奏。

AuK的技术原理

  • 整体范式: AuK 采用 flow-matching 扩散架构生成音频隐空间表示,天然适合编辑类任务,把原始音频的隐表示作为去噪起点,只修改指令要求的部分,从而更好地保留原始音色、旋律和未编辑内容,这也是它能覆盖编辑任务族的技术基础。
  • 三组件流水线架构: 系统由三部分组成:多模态大模型负责读取自然语言指令和参考音频、生成语义条件;音频 VAE 将 24kHz 波形编码为 50Hz 的声学隐空间;核心的混合 Transformer 由 10 层双流 MMDiT加 20 层单流 DiT 堆叠而成,模型宽度 1536,总参数 15 亿。
  • 大规模指令对齐训练: 训练数据约 30.3 亿条指令—音频配对,累计约 195 万小时有效监督。关键是所有任务都统一为同一种指令 + 输入音频 → 输出音频的格式,使模型通过单一接口泛化到 16 种任务。
  • 后训练与人类偏好优化: 模型在基础训练后经过人类偏好优化和强化学习后训练(RL post-training),提升生成语音的自然度、指令遵循度和听觉质量。
挖挖GitHub

如何使用AuK

  • 确认硬件环境 :准备一台显存约 24GB 级别的 NVIDIA GPU(如 RTX 3090/4090)。
  • 克隆代码仓库 :从 GitHub 克隆 Tencent-Hunyuan/AuK 仓库到本地。
  • 安装依赖环境 :按仓库要求配置 Python 环境并安装所需的依赖包。
  • 下载模型权重 :从 Hugging Face 或 ModelScope 下载 AuK权重及配套的 VAE 文件。
  • 下载语义条件模型 :单独下载并配置多模态大模型 Qwen2.5-Omni-3B,用于解析指令和参考音频。
  • 准备输入素材 :准备好目标文本、参考音频或待编辑的原始音频文件。
  • 编写自然语言指令 :根据任务需求撰写指令,如描述声音特征、指定要替换的句子或调节的音高/语速等。
  • 运行推理 :通过命令行(CLI)输入指令和素材,执行生成或编辑并等待输出。
  • 试听与调整 :检查结果音频,不满意时调整指令措辞、采样步数或 CFG 强度重新生成。

AuK的核心优势

  • 统一接口,任务全覆盖 :模型通过自然语言指令可胜任 TTS、编辑、增强、分离等 16 种语音任务,无需为每个任务单独部署模型。
  • 编辑能力业界稀缺 :支持改词、插句、调音高、改情绪等精细编辑,且能最大限度保留原始音色和语调。
  • Instruct TTS 免参考音频 :凭文字描述声音特征可生成语音,降低使用门槛。
  • 流匹配架构更保真 :采用扩散式生成而非逐 token 预测,编辑时用原音频为起点去噪,未修改部分几乎零损伤。

AuK的项目地址

  • 项目官网 :https://auk-project.github.io/
  • GitHub仓库 :https://github.com/Tencent-Hunyuan/AuK
  • HuggingFace模型库 :https://huggingface.co/tencent/AuK
  • arXiv技术论文 :https://arxiv.org/pdf/2609.08936

AuK的同类竞品对比

对比维度 | AuK(腾讯混元) | CosyVoice 3(阿里通义)

>
对比维度 AuK(腾讯混元) CosyVoice 3(阿里通义)
核心定位 统一的语音生成 + 编辑基础模型 多语言语音合成(TTS)模型
任务覆盖 16 种任务,横跨生成、内容/声学/副语言编辑、增强、分离 5 大族 聚焦 TTS、零样本克隆、指令式情感/方言控制,不支持语音编辑和分离
架构路线 流匹配扩散架构(非自回归),适合”在原音频上修改” LLM + 分块流匹配(FM)双向流式架构
参数规模 1.5B(另有 4 步推理的 AuK-Flash 蒸馏版) 开源版 0.5B,完整版 1.5B
语音编辑能力 核心强项:改词、插句、删句、调音高/语速/音量、改情绪、去口音 不支持(仅能控制新生成语音的属性)
声音克隆 Zero-shot TTS(参考音频克隆)+ Instruct TTS(文字描述造声) 3 秒音频零样本克隆,支持跨语言音色复刻
语言/方言覆盖 官方未公布完整语言列表(示例以中英为主) 9 种语言 + 18 种中文方言
实时性 非流式设计,需约 24GB 显存,偏离线生产 流式推理,首包延迟低至 150ms,适合实时对话场景

AuK的应用场景

  • 影视/短剧后期台词修复 :演员念错词或剧本微调时,直接替换录音中的个别词句,无需重新进棚配音,保留原表演情绪。
  • 播客与采访制作 :删除口误和废话、调整语速节奏、去除背景噪音和混响,把粗剪素材一键整理成成片。
  • 有声书与 AI 配音生产 :用 Instruct TTS 按角色描述生成差异化音色,同一 narrator 还能后期调整情绪和语调,降低多角色制作成本。
  • 音乐创作与二创 :改写翻唱歌词而保留原旋律和歌声特质,或从歌曲中提取人声做 remix 素材。
  • 语言训练与无障碍应用 :为有口音或语言障碍的使用者去口音、调节语速和音量,生成更清晰易懂的语音内容。
相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐