[论文解读] Melody Generation for Pop Music via Word Representation of Musical Properties
该论文提出了一种用于流行音乐的新型神经旋律生成模型,将每个音符及其属性(音高、时值、力度等)表示为序列中的唯一‘词’,通过基于循环神经网络的条件生成架构,实现端到端的旋律生成,条件输入包括和弦进行与歌曲段落信息。与先前方法相比,该模型生成的旋律更具人类特征、结构更连贯、听感更愉悦,人类评估者难以将其与人工创作的歌曲区分开。
Automatic melody generation for pop music has been a long-time aspiration for both AI researchers and musicians. However, learning to generate euphonious melody has turned out to be highly challenging due to a number of factors. Representation of multivariate property of notes has been one of the primary challenges. It is also difficult to remain in the permissible spectrum of musical variety, outside of which would be perceived as a plain random play without auditory pleasantness. Observing the conventional structure of pop music poses further challenges. In this paper, we propose to represent each note and its properties as a unique `word,' thus lessening the prospect of misalignments between the properties, as well as reducing the complexity of learning. We also enforce regularization policies on the range of notes, thus encouraging the generated melody to stay close to what humans would find easy to follow. Furthermore, we generate melody conditioned on song part information, thus replicating the overall structure of a full song. Experimental results demonstrate that our model can generate auditorily pleasant songs that are more indistinguishable from human-written ones than previous models.
研究动机与目标
- 解决使用深度学习生成音乐上连贯且悦耳的流行音乐旋律的挑战。
- 通过将每个音符视为序列中的单一‘词’,克服建模多变量音符属性(音高、时值、力度)的复杂性。
- 通过基于歌曲段落信息(如主歌、副歌)和和弦进行的条件生成,强化旋律的结构完整性。
- 通过在训练过程中对音高范围施加正则化,减少过拟合并提升旋律的可唱性。
- 实现多样化、高质量的旋律生成,使生成旋律在听感上与人工创作的旋律难以区分。
提出的方法
- 将每个音符编码为一个唯一的‘词’,将其音高、时值和力度整合为单一离散标记,降低维度并减少建模复杂度。
- 使用循环神经网络(RNN)以条件自回归方式逐词生成旋律,条件输入为和弦序列与歌曲段落标签。
- 使用在自建数据集上训练的多项式隐马尔可夫模型(HMM)自动提取和弦序列与歌曲段落标注。
- 引入音高范围正则化损失,以惩罚过大的音高变化,提升旋律的可唱性与人类特征音域。
- 采用标准RNN训练与对抗性训练(GAN)相结合的方式训练模型,以提升生成样本的多样性。
- 通过人类听觉测试与定量指标评估模型性能,并额外开展关于损失函数与训练策略的消融实验。
实验结果
研究问题
- RQ1将音符建模为编码多属性的离散‘词’,是否能提升旋律生成质量并降低训练复杂度?
- RQ2基于歌曲段落信息(如副歌与主歌)进行条件生成,对生成旋律的结构连贯性与听感质量有何影响?
- RQ3音高范围正则化在多大程度上能提升生成旋律的可唱性与人类特征?
- RQ4使用GAN进行对抗性训练是否能在不牺牲音质的前提下提升生成旋律的多样性?
- RQ5在人类评估中,该模型与先前方法相比表现如何,特别是在区分生成旋律与人工创作旋律方面?
主要发现
- 所提出的音乐属性词表示方法显著降低了模型复杂度,通过将多变量音符特征整合为单一标记,提升了训练效率。
- 基于歌曲段落信息的条件生成使旋律更具结构准确性,副歌部分展现出更高的音域与更易记忆的动机,符合设计预期。
- 音高范围正则化损失有效防止模型生成音域过宽或难以演唱的旋律,显著提升了可唱性。
- 人类评估显示,该模型生成的旋律比以往模型更难与人工创作的旋律区分开。
- 对抗性训练(GAN)提升了样本多样性,但导致模式崩溃,使相同输入下生成的旋律出现重复现象。
- 该模型在其他乐器上也表现出良好的泛化能力:已成功训练贝斯、钢琴与弦乐的独立模型,生成的旋律音准正确、和弦协调,但多轨组合仍存在不协和问题,原因在于缺乏乐器间交互建模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。