Skip to main content
QUICK REVIEW

[论文解读] Neural Melody Composition from Lyrics

Hangbo Bao, Shaohan Huang|arXiv (Cornell University)|Sep 12, 2018
Music and Audio Processing参考文献 23被引用 4
一句话总结

本文提出了一种端到端的神经序列到序列模型,用于歌词条件的旋律生成,该模型联合生成音乐音符及其精确的音节到音符对齐,包括一对一和一对多映射。模型采用双编码器分别处理歌词和上下文旋律,并使用分层RNN解码器生成旋律连贯、悦耳动听的旋律,在大规模中文流行歌曲数据集上的自动评估和人工评估中均优于基线模型。

ABSTRACT

In this paper, we study a novel task that learns to compose music from natural language. Given the lyrics as input, we propose a melody composition model that generates lyrics-conditional melody as well as the exact alignment between the generated melody and the given lyrics simultaneously. More specifically, we develop the melody composition model based on the sequence-to-sequence framework. It consists of two neural encoders to encode the current lyrics and the context melody respectively, and a hierarchical decoder to jointly produce musical notes and the corresponding alignment. Experimental results on lyrics-melody pairs of 18,451 pop songs demonstrate the effectiveness of our proposed methods. In addition, we apply a singing voice synthesizer software to synthesize the "singing" of the lyrics and melodies for human evaluation. Results indicate that our generated melodies are more melodious and tuneful compared with the baseline method.

研究动机与目标

  • 解决现有端到端神经模型在歌词条件旋律生成中缺乏对复杂音节到音符对齐处理的问题。
  • 克服现有方法仅假设一对一映射的局限性,该假设忽略了真实音乐中普遍存在的“一对多”映射现象。
  • 构建一个大规模、高精度的歌词-旋律数据集,包含18,451首中文流行歌曲和644,472个音节-旋律三元组,用于训练和评估。
  • 开发一种联合生成旋律和对齐信息的模型,提升音乐自然度和悦耳度。
  • 通过自动指标和人工评估验证模型的优越性,使用语音合成技术进行歌声合成。

提出的方法

  • 模型采用序列到序列框架,包含两个双向RNN编码器:一个用于编码当前歌词的音节,另一个用于通过注意力机制编码上下文旋律。
  • 分层RNN解码器包含三层:两层用于预测每个音符的音高和时长,一层用于预测对齐标签,指示每个音符对应哪个音节。
  • 对齐预测层使模型能够学习一对多映射,即一个音节可对应多个连续音符。
  • 模型在包含18,451首中文流行歌曲的大规模数据集上进行端到端训练,数据集对音节-音符对齐进行了精确标注。
  • 使用歌声合成器将生成的旋律和歌词渲染为音频,用于人工评估。
  • 训练目标同时优化旋律生成和对齐准确率,实现音高、时长和对齐标签的联合优化。

实验结果

研究问题

  • RQ1端到端神经网络模型能否有效从歌词生成旋律,同时学习音节与音乐音符之间的精确对齐?
  • RQ2与仅限于一对一映射的模型相比,建模一对多音节到音符对齐是否能提升旋律质量?
  • RQ3采用双编码器和分层解码的联合序列到序列框架是否能优于传统的序列标注或分类基线模型?
  • RQ4自动指标和人工评估在评估生成旋律的音乐质量方面有何差异?
  • RQ5在歌唱旋律中,精确的对齐信息在多大程度上提升了音符时长和停顿的自然度?

主要发现

  • 所提出的模型在所有自动评估指标上显著优于基线方法,展现出更优的旋律生成性能和对齐准确率。
  • 人工评估结果显示,该方法生成的旋律平均总分达到4.57,显著高于基线Seq2seq模型(3.28)和Songwriter基线(3.83)。
  • 人工标注者认为该方法生成的旋律更具旋律感和悦耳度,尤其指出其在音符时长和停顿自然度方面有明显改善。
  • 模型成功捕捉了一对多对齐模式,证据显示数据集中97.9%的歌曲至少包含一个音节映射到多个音符,该模式被模型有效学习。
  • 解码器中显式预测对齐信息显著提升了节奏和节拍的自然度,体现在‘节奏’指标得分更高(4.17 vs. 2.66,Seq2seq模型)。
  • 结果证实,在旋律生成任务中,使用精确的音节级对齐信息比传统序列到序列模型中的软注意力机制更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。