YuE2 团队 投稿
量子位 | 公众号 QbitAI
近期,香港科技大学联合M-A-P、NOIZ AI、斯坦福等机构发布并开源了一个统一符号与音频音乐生成的模型YuE2,将开源音乐生成的质量推向与前沿闭源模型正面竞争的位置。
在WildSongBench的192个prompts评测中,YuE2已逼近Suno v5、Mureka 9,同时超过Suno最新一代闭源模型v6及v6 Wild;八选一后更以6.9632拿下17组参评系统最高分,遥遥领先多款前沿闭源模型。

△YuE2登顶GitHub Trending榜

△AI垂直领域博主AI Search发帖介绍YuE2
但YuE2的野心远不止把开源音乐生成推到frontier水平。它还试图解决AI音乐创作长期存在的另一个难题:如何让一次性的生成结果,变成一个可以被理解、定位、修改,并持续迭代的创作过程。
如果说过去用户更多是在一次次“抽卡”中寻找满意的结果;那么YuE2希望把一首生成出来的歌,真正变成可以继续打磨的作品。
开源SOTA,逼近闭源Suno v5,超越最新Suno v6
采用WildSongBench进行评测,在192个prompts上,YuE2的SongBench平均分达到6.7316,逼近Suno v5的6.8721和Mureka 9的6.9377;同时超过Suno最新一代模型v6(6.5562)及v6 Wild(6.4195)。在八选一设置下,YuE2得分进一步提升至6.9632,超过包括Suno v5、v6、MiniMax Music 2.6、Mureka 9在内的多款前沿闭源音乐模型。

△歌曲质量综合了SongBench和SongEval的评估结果;文本对齐综合了MuLan、AllMusicCaps以及Qwen3-Omni Judger的结果。两个坐标轴均显示归一化的比较指数。气泡面积代表AudioBox的生成质量。
Agentic Music Editing:用一句话,精细修改已经生成的音乐
不只是生成一首歌,YuE2把音乐变成一份可以继续被修改的“工程文件”。在生成音频之前,模型会先规划一份包含人声旋律、器乐旋律、和弦和段落结构的双轨曲稿,并以ABC文本记谱形式保存。这种“先写下作曲安排,再生成最终声音”的方式,就是YuE2引入的核心机制创新——symbolic planning(乐谱规划)。音频中的旋律和和声不再是黑盒结果,而是能够被创作者定位、修改,再重新演绎。
这也使得YuE2能够支持Agentic Music Editing。比如,用户可以直接说:“保留副歌的人声旋律,但插入一段《小星星》萨克斯solo,和声变得更现代一些。”接入YuE2的Agent可以读取原曲的旋律与和弦,结合乐理提出修改方案,定位并改写对应的和弦或音符,再调用YuE2生成新的完整版本。用户不需要自己理解乐谱,也可以通过自然语言持续调整已有的歌曲。
对于专业音乐人,同一套机制则提供更直接的控制。例如,一首副歌原本采用4–5–3–6–2–5–1的和声进行,音乐人可以保留原有Vocal与Ins两条旋律,只将其中一个和弦修改为减七和弦,再让YuE2重新演绎。改动进入声音的同时,没有修改的旋律与和声可以被尽量保留。
实验也验证了这种编辑能力。研究者对完整作品中的旋律与和弦进行定向修改后,目标音高匹配率由0.83%提升至93.75%,目标和弦一致率由0提升至83.13%;未修改部分的旋律和和弦相似度分别保持在0.96和0.93以上。重新生成整曲时,改动能够进入声音,其他部分的主要旋律与和弦内容也能得到较好保留。
YuE2的symbolic planning创新,使歌曲先以可读、可编辑的曲稿表示,再由模型将修改后的作曲安排重新演绎为完整音频,从而把过去偏“黑盒”的音乐生成,变成可以定位、修改、验证并持续迭代的创作过程。
Cover Song:让一首歌重新长成另一种样子
一首已经完成的歌,也可以成为下一轮创作的起点。与直接基于音频模仿的翻唱方式不同,YuE2首先理解歌曲中的旋律、和声和结构,再重新组织声音表达。借助SheetSage2,已有录音被还原成包含旋律、和弦、节拍等信息的可编辑曲稿,再基于这份曲稿重新生成新的演绎版本。



