Skip to main content
QUICK REVIEW

[论文解读] Music Generation with Deep Learning

Vasanth Kalingeri, Srikanth Grandhe|arXiv (Cornell University)|Dec 15, 2016
Music and Audio Processing参考文献 2被引用 7
一句话总结

本文提出一种基于频域表示的深度学习方法,用于直接从原始音频波形生成音乐,通过在LSTM架构中引入全连接层和卷积层来提升音质。双线性LSTM模型在盲听测试中表现出最高的感知质量,优于基线模型,能够学习生成连贯、悦耳的音乐,且无需依赖乐谱或结构化MIDI数据。

ABSTRACT

The use of deep learning to solve problems in literary arts has been a recent trend that has gained a lot of attention and automated generation of music has been an active area. This project deals with the generation of music using raw audio files in the frequency domain relying on various LSTM architectures. Fully connected and convolutional layers are used along with LSTM's to capture rich features in the frequency domain and increase the quality of music generated. The work is focused on unconstrained music generation and uses no information about musical structure(notes or chords) to aid learning.The music generated from various architectures are compared using blind fold tests. Using the raw audio to train models is the direction to tapping the enormous amount of mp3 files that exist over the internet without requiring the manual effort to make structured MIDI files. Moreover, not all audio files can be represented with MIDI files making the study of these models an interesting prospect to the future of such models.

研究动机与目标

  • 从原始音频波形直接生成高质量、无约束的音乐,不依赖乐谱或MIDI文件。
  • 通过在频域中使用带有额外全连接层和卷积层的深层LSTM架构建模音频,提升音乐生成质量。
  • 通过盲听测试评估模型性能,重点关注感知质量而非音乐理论的结构准确性。
  • 识别架构改进措施(如双线性LSTM和多层LSTM设计),以增强长距离依赖学习和音频连贯性。
  • 探索均方误差损失的替代方案,建议未来采用对抗性训练以更好地匹配人类感知。

提出的方法

  • 使用傅里叶变换将音频样本从时域波形转换为8000维的频域向量,实部与虚部拼接。
  • 模型在10秒音频片段上进行训练,每轮前向传播使用40个时间步的上下文来处理10秒音频。
  • 基础模型在频域输入上使用单一LSTM;增强模型包含全连接层、一维与二维卷积层,以及具有并行LSTM单元的双线性LSTM架构。
  • 训练使用RMSProp优化器,学习率为0.0001,损失函数为均方误差;通过L2正则化和Dropout(全连接层为0.2,LSTM层为0.5)进行正则化。
  • 在1200、1500、1800和2100个训练周期后采样生成音频,通过人工筛选与盲听测试选择表现最佳的模型。
  • 通过10名评分者参与的盲听测试评估音频质量,评分范围为1–5分,使用来自不同模型的30段生成音频进行评估。

实验结果

研究问题

  • RQ1深度学习模型能否在不依赖乐谱或MIDI数据的情况下,直接从原始音频生成感知上令人愉悦的音乐?
  • RQ2不同架构组件(如全连接层、一维/二维卷积、双线性LSTM结构)如何影响生成音频的质量与连贯性?
  • RQ3在训练数据有限的情况下,通过增加层数提升模型容量是否能改善音乐生成性能?
  • RQ4尽管受制于单元大小的硬件限制,频域LSTM建模是否能够捕捉生成连贯音乐所必需的长距离依赖关系?
  • RQ5与均方误差损失相比,损失函数的选择(如均方误差)与未来替代方案(如对抗性损失)在感知音频质量上的表现如何?

主要发现

  • 双线性LSTM模型在盲听测试中获得平均3.6分(满分5分),显著优于基线模型(2.4分)。
  • 二维卷积LSTM模型排名第二,平均得分为3.4分,表明频域中的空间卷积能有效提升特征学习能力。
  • 所有提出的模型(包括全连接、一维卷积和堆叠LSTM)均优于基线模型,平均得分介于2.8至3.4之间,证明架构增强的有效性。
  • 双线性LSTM模型收敛更快且性能更优,归因于并行学习路径可实现更高效的特征提取。
  • 尽管训练数据为钢琴录音,模型仍生成了电子合成的、非原声乐器的音乐,表明其具备超越源乐器特性的泛化能力。
  • 各模型的训练损失曲线相似,且与感知质量无明显相关性,表明损失函数本身并非音频质量的可靠代理指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。