首页/ 资讯/ YuE2 港科技大联合 M-A-P 团队开源的音乐生成模型

YuE2 港科技大联合 M-A-P 团队开源的音乐生成模型

拆宝 2026-09-16 0 阅读

YuE2是什么

YuE2是香港科技大学与M-A-P团队开源的音乐生成模型。模型能根据歌词和风格生成可编辑的ABC乐谱(旋律+和弦),再渲染为48kHz完整歌曲,让创作过程白盒可控。模型支持从零创作、零样本翻唱、Agent对话式编辑乐谱。在WildSongBench基准上SongBench Avg达6.9632,超越Suno v5等商业模型。

YuE2

YuE2的主要功能

  • 符号规划创作 :输入歌词与风格提示,先生成可编辑的旋律+和弦 ABC 乐谱,再渲染为带人声与伴奏的完整歌曲。

  • 零样本翻唱 :用 SheetSage2 将原曲录音转录为乐谱,再以新风格或新歌词重新演绎,无需针对翻唱任务微调。

  • Agent 对话式编辑 :围绕乐谱与 Agent 对话,修改和声、旋律、速度或曲式后重新渲染出新版本。

  • 音频转谱(SheetSage2) :将任意录音转录为可检视、可修改的乐谱,是翻唱与编辑功能的入口。

  • 音乐理解(MERT2) :提供全曲级音乐表征,支撑转谱等下游任务,本身也在 MARBLE 基准 15 项中拿下 14 项 SOTA。

YuE2的技术原理

  • 符号规划中间层 :YuE2 的核心设计是在文本/音频条件与最终波形之间插入一层显式的符号乐谱(ABC 记谱,含旋律与和弦)。乐谱作为白盒接口,既可被人或 Agent 读取、修改,又决定了后续声学生成的结构,使创作从黑盒抽卡变为可控的作曲过程。

  • AR–NAR 混合专家架构 :模型采用单一的 Mixture-of-Transformers 骨干:AR 专家以因果注意力自回归预测乐谱 token 与语义 token,保证音乐的结构与歌词对齐;NAR 专家以双向注意力对声学 latent 做 flow matching 预测(25 Hz × 64),保证音频质量。两类专家共享混合自注意力层与 FFN,在一个 checkpoint 内统一处理规划与渲染。

  • VAE 声学生成管线 :NAR 专家输出的声学 latent 经 VAE 解码器还原为 48 kHz 立体声音频,全程无量化损失。训练时由离线模块构建目标:SheetSage2 从音频提取乐谱目标,MERT2+CVQ 生成语义 token 目标,VAE 编码器生成 latent 目标。

  • 三模式统一于同一权重 :创作、翻唱、编辑共用同一生成 checkpoint,唯一区别在于乐谱的来源不同,分别由模型自生成、SheetSage2 转录、或人工/Agent 修改后提供;翻唱时改用仅旋律模式,让伴奏自由适配新风格。

  • 分阶段推理 API :推理被拆为 plan() → generate_semantic() → synthesize() → decode() 四个阶段,乐谱、语义 token、声学 latent 及生成参数都会落盘保留。用户可在任意阶段介入:导出乐谱编辑后重渲染,或复用已生成的 plan 仅更换解码器,兼顾灵活性与可复现性。

如何使用YuE2

  • 环境准备 :需要 Linux 系统、Python 3.12,及一块支持 BF16 的 NVIDIA GPU,模型权重首次运行时会自动从 Hugging Face 下载。

  • 安装部署 : git clone 仓库后创建虚拟环境,执行 pip install . 即可完成安装。

  • 快速生成第一首歌 :运行 python examples/generate.py --output outputs/first-song ,可从内置示例生成歌曲,输出目录包含音频(flac)、乐谱及全部中间产物。

  • Python API 调用 :通过 YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B") 加载管线,传入风格、歌词即可生成; cot 参数控制模式—— "full" 生成可编辑乐谱(默认)、 "melody" 仅旋律规划、 "off" 直接生成。

  • 翻唱一首歌 :先用 SheetSage2 将原曲录音转录为旋律 ABC 谱,再以 cot="melody" 传入新歌词或目标风格重新生成。

  • 编辑已有作品 :调用 pipe.plan() 导出乐谱,人工或让 Agent 修改 ABC 文件后,用 --abc-file edited.abc --cot full 重新渲染出新版本。

  • Agent skill 用法 :将仓库中的 skills/yue2-music/ 导入支持 SKILL.md 的 Agent,即可通过自然对话完成写歌、转谱、改谱和版本对比。

YuE2的核心优势

  • 质量对标商业模型 :WildSongBench 上 SongBench Avg 达 6.9632(best-of-8),超越 Suno v5、Mureka 9 等商业产品,刷新开源音乐生成上限。

  • 白盒可控创作 :首创符号规划管线,旋律与和弦以 ABC 乐谱形式显式呈现,人和 Agent 都能在渲染前读取、修改作品。

  • 三模式统一权重 :创作、零样本翻唱、对话式编辑共用同一 checkpoint,翻唱无需专门微调即可实现 0.647 CLEWS mAP 的源曲保持度。

  • 完全本地开源 :代码遵循 Apache 2.0,3.6B 权重开放下载,单卡 24GB 显存即可离线运行,数据不出本机。

  • 生态配套完整 :同步开源 SheetSage2 转谱、MERT2 理解模型、WildSongBench 评测集及 yue2-music Agent skill,覆盖转谱→创作→编辑→评测全链路。

  • 分阶段可干预 : plan() → generate_semantic() → synthesize() → decode() 四段式 API,乐谱、语义 token、latent 全部落盘,支持复用计划、中途换解码器。

YuE2的项目地址

  • 项目官网 :https://map-yue2.github.io/

  • GitHub仓库 :https://github.com/multimodal-art-projection/YuE

YuE2的同类竞品对比

对比维度 | YuE2(M-A-P / 港科大) | Suno v5.5(Suno Inc.)

对比维度

YuE2(M-A-P / 港科大)

Suno v5.5(Suno Inc.)

产品性质

开源研究模型(约 3.6B 参数)

闭源商业音乐生成服务

生成质量

SongBench Avg 6.9632(best-of-8)/ 6.7316(标准版),17 个设置中排第一与第四

SongBench Avg 6.7150,排第五,低于 YuE2 两个版本

核心机制

符号规划:先生成可编辑 ABC 乐谱(旋律+和弦),再渲染为 48kHz 音频,白盒可控

端到端音频生成,无中间乐谱层,黑盒模式

可控性

乐谱可读、可改、可复用;支持 Agent 对话式编辑和声、旋律、速度、曲式

主要通过提示词控制,无法逐音符干预,修改只能整曲重抽

翻唱能力

零样本翻唱:SheetSage2 转谱后换风格/歌词,CLEWS mAP 0.647(948 作品)

无显式转谱-重演绎管线,翻唱依赖 prompt 引导,旋律保持度不可控

歌词清晰度

PER 发音错误率 9.79%(Bo8)/ 8.44%(标准版)

PER 5.96%,明显优于 YuE2,是参测系统中歌词咬字最准的之一

文本对齐

MuLan 0.5051

MuLan 0.5089,略高于 YuE2

开源与部署

代码 Apache 2.0、权重开放下载,本地单卡 24GB 显存可跑,数据不出机

闭源,仅云端调用,无法本地部署,歌词与作品数据托管于厂商

YuE2的应用场景

  • 个人音乐创作 :不会作曲编曲的素人输入歌词+风格即可成歌,能通过改乐谱精细调整旋律走向,把灵感变成完整作品。

  • 翻唱与二次创作 :用 SheetSage2 将原曲转谱后,一键把歌曲改编成爵士、摇滚等新风格,或替换歌词做多语言版本,适配粉丝二创与短视频改编需求。

  • 影视 / 游戏 / 广告配乐 Demo :制片方快速生成带人声或纯伴奏的候选配乐,低成本试错后再决定是否聘请真人制作,大幅压缩前期沟通成本。

  • 音乐教育与和声分析 :教师用其生成指定和弦走向、曲式结构的示例乐曲,学生可对照 ABC 乐谱学习作曲技法,实现听得见、看得见、改得动的教学闭环。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐