Skip to main content
QUICK REVIEW

[论文解读] Learning to Generate Music With Sentiment

Lucas N. Ferreira, Jim Whitehead|arXiv (Cornell University)|Mar 9, 2021
Music and Audio Processing参考文献 16被引用 15
一句话总结

该论文提出了一种解耦的深度生成模型,结合改进的LSTM(mLSTM)与逻辑回归,通过控制情感来生成音乐。通过识别并优化mLSTM中与情感相关的神经元,该模型能够生成具有预期情感基调的音乐——正向音乐的准确率达到84%,负向音乐达到67%,人类评估者确认了预期的情感表达,但负向音乐表现出一定的模糊性。

ABSTRACT

Deep Learning models have shown very promising results in automatically composing polyphonic music pieces. However, it is very hard to control such models in order to guide the compositions towards a desired goal. We are interested in controlling a model to automatically generate music with a given sentiment. This paper presents a generative Deep Learning model that can be directed to compose music with a given sentiment. Besides music generation, the same model can be used for sentiment analysis of symbolic music. We evaluate the accuracy of the model in classifying sentiment of symbolic music using a new dataset of video game soundtracks. Results show that our model is able to obtain good prediction accuracy. A user study shows that human subjects agreed that the generated music has the intended sentiment, however negative pieces can be ambiguous.

研究动机与目标

  • 开发一种生成式深度学习模型,能够生成具有指定情感(正面或负面)的符号化音乐。
  • 识别并利用mLSTM中的情感特异性神经元,以实现可控的音乐生成。
  • 使用新创建的视频游戏原声音乐数据集,评估模型在情感分类和音乐生成两方面的性能。
  • 探索在符号化音乐这一尚未充分研究的领域中,解耦情感与音乐生成的可行性。
  • 为视频游戏、电影及治疗场景中的情感音乐创作提供应用支持。

提出的方法

  • 在728首未标注的视频游戏原声MIDI作品上训练生成式mLSTM,以学习音乐表征。
  • 训练一个逻辑回归模型,利用mLSTM的隐藏状态对情感进行分类,识别出负责情感信号的神经元。
  • 使用遗传算法优化161个特定mLSTM神经元的权重,以生成具有期望情感(正面或负面)的音乐。
  • 遗传算法的适应度函数衡量30首生成作品中预测情感与目标情感(0或1)之间的均方误差。
  • 通过Amazon MTurk平台的人类标注者使用唤醒度-效价模型对生成作品进行标注,其中效价映射为情感(正面/负面)。
  • 模型作为情感分类器(在保留数据集上)和生成器(通过用户研究评估生成作品)进行双重评估。

实验结果

研究问题

  • RQ1能否有效控制生成式深度学习模型,以生成具有特定情感的符号化音乐?
  • RQ2能否在mLSTM中识别并操控情感特异性神经元,以引导音乐生成?
  • RQ3与完全监督的LSTM相比,该解耦生成模型在符号化音乐情感分类中的表现如何?
  • RQ4人类听众在多大程度上能感知生成音乐中预设的情感,尤其是负向音乐?
  • RQ5该模型能否扩展为生成具有多类别情绪或连续唤醒度-效价值的音乐?

主要发现

  • 所提出的模型在生成具有预期正面情感的音乐方面达到了84%的准确率,经人类标注者确认。
  • 该模型在生成具有预期负面情感的音乐方面达到了67%的准确率,但听众普遍认为负向音乐具有模糊性。
  • 与完全监督的LSTM相比,结合逻辑回归的生成式mLSTM在情感分类准确率上高出约30%。
  • 人类标注者一致认为生成的正面音乐传达了预期的情感,而负面音乐在各项指标中表现出混合效价,表明部分成功。
  • 遗传算法成功优化了神经元权重以实现情感控制,但负向生成的适应度较低,表明训练数据可能存在不平衡。
  • 本研究首次发布了标注了情感的符号化音乐数据集,为未来在情感音乐生成领域的研究提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。