Skip to main content
QUICK REVIEW

[论文解读] TeleMelody: Lyric-to-Melody Generation with a Template-Based Two-Stage Method

Zeqian Ju, Peiling Lu|arXiv (Cornell University)|Sep 20, 2021
Music and Audio Processing参考文献 22被引用 7
一句话总结

TeleMelody 提出了一种基于音乐模板(调性、和弦进行、节奏模式、终止式)的两阶段歌词到旋律生成框架,用于连接歌词与旋律。通过将歌词到模板与模板到旋律的生成解耦,该方法在显著减少配对歌词-旋律数据需求的同时,实现了更高的旋律质量与可控性,在客观与主观评估中均优于端到端模型。

ABSTRACT

Lyric-to-melody generation is an important task in automatic songwriting. Previous lyric-to-melody generation systems usually adopt end-to-end models that directly generate melodies from lyrics, which suffer from several issues: 1) lack of paired lyric-melody training data; 2) lack of control on generated melodies. In this paper, we develop TeleMelody, a two-stage lyric-to-melody generation system with music template (e.g., tonality, chord progression, rhythm pattern, and cadence) to bridge the gap between lyrics and melodies (i.e., the system consists of a lyric-to-template module and a template-to-melody module). TeleMelody has two advantages. First, it is data efficient. The template-to-melody module is trained in a self-supervised way (i.e., the source template is extracted from the target melody) that does not need any lyric-melody paired data. The lyric-to-template module is made up of some rules and a lyric-to-rhythm model, which is trained with paired lyric-rhythm data that is easier to obtain than paired lyric-melody data. Second, it is controllable. The design of template ensures that the generated melodies can be controlled by adjusting the musical elements in template. Both subjective and objective experimental evaluations demonstrate that TeleMelody generates melodies with higher quality, better controllability, and less requirement on paired lyric-melody data than previous generation systems.

研究动机与目标

  • 解决端到端歌词到旋律生成系统中配对歌词-旋律训练数据稀缺的问题。
  • 通过允许用户操控调性、和弦进行等音乐元素,提升生成旋律的可控性。
  • 将复杂的歌词到旋律任务分解为两个可管理的子任务:歌词到模板生成与模板到旋律生成。
  • 通过利用自监督学习以及基于规则或数据挖掘的配对数据(如歌词-节奏)而非昂贵的歌词-旋律配对,提升数据效率。
  • 通过知识引导的注意力机制,在模板到旋律模块中提升生成旋律的一致性与音乐连贯性。

提出的方法

  • 提出两阶段框架:首先,歌词到模板模块从歌词中预测音乐模板(调性、和弦进行、节奏模式、终止式);其次,模板到旋律模块基于模板生成旋律。
  • 通过从目标旋律中提取模板,以自监督方式训练模板到旋律模块,从而无需配对的歌词-旋律数据。
  • 使用在配对歌词-节奏数据上训练的端到端歌词-节奏模型(可从音频-歌词对中轻松获取)来预测模板中的节奏模式。
  • 通过标点符号映射推断终止式,并使用预设的音乐规则定义和弦进行与调性。
  • 在序列到序列的模板到旋律模型中应用基于音乐知识的注意力正则化,以提升对齐效果与可控性。
  • 利用外部歌词-音频数据进行数据挖掘,使系统即使在无真人标注的歌词-旋律对的情况下仍能有效运行。

实验结果

研究问题

  • RQ1与端到端模型相比,两阶段模板化框架是否能降低歌词到旋律生成中的数据依赖?
  • RQ2模板化设计在多大程度上可通过允许用户操控音乐元素(如调性、和弦进行)来提升生成旋律的可控性?
  • RQ3当系统分别在爬取的歌词-节奏数据与真人标注的歌词-旋律数据上训练时,其性能如何变化?
  • RQ4在无任何配对歌词-旋律数据的情况下,基于模板-旋律对的自监督训练能否实现具有竞争力的性能?
  • RQ5模板到旋律模块中的知识引导注意力是否能带来更好的对齐效果与更高的旋律质量?

主要发现

  • 当在真人标注的歌词-节奏数据上训练时,TeleMelody 在客观指标上表现优异:PD 为 46.73%,DD 为 52.95%,MD 为 2.36,优于 SongMASS(PD 34.32%,DD 47.88%,MD 2.61)。
  • 即使仅在 100% 爬取的歌词-节奏数据上训练,TeleMelody 仍保持强劲性能(PD 43.86%,DD 52.06%,MD 2.40),与真人标注数据相比性能下降极小。
  • 仅使用 50% 的爬取数据即可获得具有竞争力的结果(PD 41.42%,DD 48.59%,MD 2.40),证明了其极高的数据效率。
  • 将歌词-节奏模型替换为手工规则(无配对数据)后,性能显著下降(PD 35.60%,DD 47.93%,MD 2.55),证实了学习模型的价值。
  • 在主观评估中,TeleMelody 生成的旋律在感知质量与可控性方面均优于端到端模型。
  • 模板化设计使用户能够有效控制调性、和弦进行与节奏,拓展了应用范围,超越了固定生成系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。