[论文解读] SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition
SongComposer 是一种大型语言模型,通过使用符号化歌曲表示法生成连贯的歌词和旋律,实现了文本与音乐的精确对齐。通过引入针对音高、时值和休止时值的专用分词方式,并在大规模数据集(SongCompose-PT)上进行预训练,SongComposer 在歌词转旋律、旋律转歌词以及文本转歌曲生成任务中均优于 GPT-4,展现出更优的标记效率和可读性输出。
Creating lyrics and melodies for the vocal track in a symbolic format, known as song composition, demands expert musical knowledge of melody, an advanced understanding of lyrics, and precise alignment between them. Despite achievements in sub-tasks such as lyric generation, lyric-to-melody, and melody-to-lyric, etc, a unified model for song composition has not yet been achieved. In this paper, we introduce SongComposer, a pioneering step towards a unified song composition model that can readily create symbolic lyrics and melodies following instructions. SongComposer is a music-specialized large language model (LLM) that, for the first time, integrates the capability of simultaneously composing lyrics and melodies into LLMs by leveraging three key innovations: 1) a flexible tuple format for word-level alignment of lyrics and melodies, 2) an extended tokenizer vocabulary for song notes, with scalar initialization based on musical knowledge to capture rhythm, and 3) a multi-stage pipeline that captures musical structure, starting with motif-level melody patterns and progressing to phrase-level structure for improved coherence. Extensive experiments demonstrate that SongComposer outperforms advanced LLMs, including GPT-4, in tasks such as lyric-to-melody generation, melody-to-lyric generation, song continuation, and text-to-song creation. Moreover, we will release SongCompose, a large-scale dataset for training, containing paired lyrics and melodies in Chinese and English.
研究动机与目标
- 开发一种能够使用符号化音乐表示法,以类人方式同时创作歌词与旋律的大型语言模型。
- 通过使用结构化、人工设计的符号记谱法,而非量化音频信号,克服大型语言模型中基于音频的音乐建模的局限性。
- 通过一种新颖的歌词-旋律对元组表示法,实现歌词与乐音之间的精确对齐。
- 在包含中文与英文歌词、旋律及成对数据的大规模多语言数据集(SongCompose-PT)上对模型进行预训练。
- 通过使用 10,000 个精心筛选的问答对,增强指令遵循能力,实现在统一框架下支持多样化的歌曲生成任务。
提出的方法
- 该模型采用一种新颖的元组设计,将每个歌词词素与其对应的音乐属性(音高、时值、休止时值)进行绑定,确保语义清晰与对齐准确。
- 引入针对音高(如 'F4')、时值(如 '1.0s')和休止时值的专用标记,使大型语言模型能够直接解析音乐符号,无需音频编码。
- 在包含 280,000 首歌词、20,000 段旋律及 15,000 组成对的歌词-旋律数据集 SongCompose-PT 上进行预训练,以建立基础的音乐理解能力。
- 通过 10,000 个问答式对话对进行指令跟随能力的微调,涵盖多样化的歌曲生成任务,如歌词转旋律和文本转歌曲生成。
- 符号化表示法可实现高效、灵活且人类可读的输出,相比基于音频的分词方式,显著减少标记数量并提升可解释性。
- 消融实验证实,离散时值与音符标记化对准确生成旋律及实现对齐具有必要性。

实验结果
研究问题
- RQ1大型语言模型是否能有效利用符号化歌曲表示法,生成连贯且音乐上准确的歌词与旋律?
- RQ2在歌曲生成任务中,符号化表示法相较于基于音频的分词方式,在效率、对齐性与性能方面有何差异?
- RQ3大规模、多语言、成对的歌词-旋律数据集对模型学习音乐-文本关系能力有何影响?
- RQ4通过问答对进行指令微调,能在多大程度上提升模型在多样化歌曲生成任务中的适应性?
- RQ5针对音高、时值和休止时值的专用分词方式是否能显著提升模型在旋律与歌词生成中的表现?
主要发现
- SongComposer 在歌词转旋律生成任务中优于 GPT-4,Bert Score 达到 0.653,旋律时长(MD)为 2.05,而 GPT-4 分别为 0.600 和 2.45。
- 在预训练阶段同时使用纯歌词与纯旋律数据集,可实现最佳性能,表明二者在模型学习中存在协同增效作用。
- 离散时值标记化使旋律转歌词任务中的 Bert Score 提升超过 0.03,证实其对结构化音乐理解的重要性。
- 专用音符标记显著提升了歌词转旋律与旋律转歌词任务中的表现,增强了清晰度与学习效率。
- 在使用完整标记化(音高、时值、休止)时,模型在 100% 的情况下均能正确输出格式;若省略则导致格式失败。
- 消融实验证实,通过显式音乐属性表达的符号化表示法,相比隐式基于音频的建模,能实现更准确、更高效的歌曲生成。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。