YuE2 港科技大联合 M-A-P 团队开源的音乐生成模型
YuE2是什么
YuE2是香港科技大学与M-A-P团队开源的音乐生成模型。模型能根据歌词和风格生成可编辑的ABC乐谱(旋律+和弦),再渲染为48kHz完整歌曲,让创作过程白盒可控。模型支持从零创作、零样本翻唱、Agent对话式编辑乐谱。在WildSongBench基准上SongBench Avg达6.9632,超越Suno v5等商业模型。

YuE2的主要功能
符号规划创作 :输入歌词与风格提示,先生成可编辑的旋律+和弦 ABC 乐谱,再渲染为带人声与伴奏的完整歌曲。
零样本翻唱 :用 SheetSage2 将原曲录音转录为乐谱,再以新风格或新歌词重新演绎,无需针对翻唱任务微调。
Agent 对话式编辑 :围绕乐谱与 Agent 对话,修改和声、旋律、速度或曲式后重新渲染出新版本。
音频转谱(SheetSage2) :将任意录音转录为可检视、可修改的乐谱,是翻唱与编辑功能的入口。
音乐理解(MERT2) :提供全曲级音乐表征,支撑转谱等下游任务,本身也在 MARBLE 基准 15 项中拿下 14 项 SOTA。
YuE2的技术原理
符号规划中间层 :YuE2 的核心设计是在文本/音频条件与最终波形之间插入一层显式的符号乐谱(ABC 记谱,含旋律与和弦)。乐谱作为白盒接口,既可被人或 Agent 读取、修改,又决定了后续声学生成的结构,使创作从黑盒抽卡变为可控的作曲过程。
AR–NAR 混合专家架构 :模型采用单一的 Mixture-of-Transformers 骨干:AR 专家以因果注意力自回归预测乐谱 token 与语义 token,保证音乐的结构与歌词对齐;NAR 专家以双向注意力对声学 latent 做 flow matching 预测(25 Hz × 64),保证音频质量。两类专家共享混合自注意力层与 FFN,在一个 checkpoint 内统一处理规划与渲染。
VAE 声学生成管线 :NAR 专家输出的声学 latent 经 VAE 解码器还原为 48 kHz 立体声音频,全程无量化损失。训练时由离线模块构建目标:SheetSage2 从音频提取乐谱目标,MERT2+CVQ 生成语义 token 目标,VAE 编码器生成 latent 目标。
三模式统一于同一权重 :创作、翻唱、编辑共用同一生成 checkpoint,唯一区别在于乐谱的来源不同,分别由模型自生成、SheetSage2 转录、或人工/Agent 修改后提供;翻唱时改用仅旋律模式,让伴奏自由适配新风格。
分阶段推理 API :推理被拆为 plan() → generate_semantic() → synthesize() → decode() 四个阶段,乐谱、语义 token、声学 latent 及生成参数都会落盘保留。用户可在任意阶段介入:导出乐谱编辑后重渲染,或复用已生成的 plan 仅更换解码器,兼顾灵活性与可复现性。
如何使用YuE2
环境准备 :需要 Linux 系统、Python 3.12,及一块支持 BF16 的 NVIDIA GPU,模型权重首次运行时会自动从 Hugging Face 下载。
安装部署 : git clone 仓库后创建虚拟环境,执行 pip install . 即可完成安装。
快速生成第一首歌 :运行 python examples/generate.py --output outputs/first-song ,可从内置示例生成歌曲,输出目录包含音频(flac)、乐谱及全部中间产物。
Python API 调用 :通过 YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B") 加载管线,传入风格、歌词即可生成; cot 参数控制模式—— "full" 生成可编辑乐谱(默认)、 "melody" 仅旋律规划、 "off" 直接生成。
翻唱一首歌 :先用 SheetSage2 将原曲录音转录为旋律 ABC 谱,再以 cot="melody" 传入新歌词或目标风格重新生成。
编辑已有作品 :调用 pipe.plan() 导出乐谱,人工或让 Agent 修改 ABC 文件后,用 --abc-file edited.abc --cot full 重新渲染出新版本。
Agent skill 用法 :将仓库中的 skills/yue2-music/ 导入支持 SKILL.md 的 Agent,即可通过自然对话完成写歌、转谱、改谱和版本对比。
YuE2的核心优势
质量对标商业模型 :WildSongBench 上 SongBench Avg 达 6.9632(best-of-8),超越 Suno v5、Mureka 9 等商业产品,刷新开源音乐生成上限。
白盒可控创作 :首创符号规划管线,旋律与和弦以 ABC 乐谱形式显式呈现,人和 Agent 都能在渲染前读取、修改作品。
三模式统一权重 :创作、零样本翻唱、对话式编辑共用同一 checkpoint,翻唱无需专门微调即可实现 0.647 CLEWS mAP 的源曲保持度。
完全本地开源 :代码遵循 Apache 2.0,3.6B 权重开放下载,单卡 24GB 显存即可离线运行,数据不出本机。
生态配套完整 :同步开源 SheetSage2 转谱、MERT2 理解模型、WildSongBench 评测集及 yue2-music Agent skill,覆盖转谱→创作→编辑→评测全链路。
分阶段可干预 : plan() → generate_semantic() → synthesize() → decode() 四段式 API,乐谱、语义 token、latent 全部落盘,支持复用计划、中途换解码器。
YuE2的项目地址
项目官网 :https://map-yue2.github.io/
GitHub仓库 :https://github.com/multimodal-art-projection/YuE
YuE2的同类竞品对比
对比维度 | YuE2(M-A-P / 港科大) | Suno v5.5(Suno Inc.)
对比维度 | YuE2(M-A-P / 港科大) | |
|---|---|---|
产品性质 | 开源研究模型(约 3.6B 参数) | 闭源商业音乐生成服务 |
生成质量 | SongBench Avg 6.9632(best-of-8)/ 6.7316(标准版),17 个设置中排第一与第四 | SongBench Avg 6.7150,排第五,低于 YuE2 两个版本 |
核心机制 | 符号规划:先生成可编辑 ABC 乐谱(旋律+和弦),再渲染为 48kHz 音频,白盒可控 | 端到端音频生成,无中间乐谱层,黑盒模式 |
可控性 | 乐谱可读、可改、可复用;支持 Agent 对话式编辑和声、旋律、速度、曲式 | 主要通过提示词控制,无法逐音符干预,修改只能整曲重抽 |
翻唱能力 | 零样本翻唱:SheetSage2 转谱后换风格/歌词,CLEWS mAP 0.647(948 作品) | 无显式转谱-重演绎管线,翻唱依赖 prompt 引导,旋律保持度不可控 |
歌词清晰度 | PER 发音错误率 9.79%(Bo8)/ 8.44%(标准版) | PER 5.96%,明显优于 YuE2,是参测系统中歌词咬字最准的之一 |
文本对齐 | MuLan 0.5051 | MuLan 0.5089,略高于 YuE2 |
开源与部署 | 代码 Apache 2.0、权重开放下载,本地单卡 24GB 显存可跑,数据不出机 | 闭源,仅云端调用,无法本地部署,歌词与作品数据托管于厂商 |
YuE2的应用场景
个人音乐创作 :不会作曲编曲的素人输入歌词+风格即可成歌,能通过改乐谱精细调整旋律走向,把灵感变成完整作品。
翻唱与二次创作 :用 SheetSage2 将原曲转谱后,一键把歌曲改编成爵士、摇滚等新风格,或替换歌词做多语言版本,适配粉丝二创与短视频改编需求。
影视 / 游戏 / 广告配乐 Demo :制片方快速生成带人声或纯伴奏的候选配乐,低成本试错后再决定是否聘请真人制作,大幅压缩前期沟通成本。
音乐教育与和声分析 :教师用其生成指定和弦走向、曲式结构的示例乐曲,学生可对照 ABC 乐谱学习作曲技法,实现听得见、看得见、改得动的教学闭环。