Skip to main content
QUICK REVIEW

[论文解读] Neural Translation of Musical Style

Iman Malik, Carl Henrik Ek|arXiv (Cornell University)|Aug 11, 2017
Cognitive Science and Education Research参考文献 13被引用 21
一句话总结

本文提出StyleNet,一种基于长短期记忆(LSTM)网络的深度学习模型,通过预测音符力度来学习从乐谱生成富有表现力的音乐演奏。该模型通过了音乐版图灵测试,在短时和完整时长的音频片段中生成的演奏与人类演奏无法区分,证明其能够无需显式规则建模即可合成自然、类人表现力的音乐。

ABSTRACT

Music is an expressive form of communication often used to convey emotion in scenarios where "words are not enough". Part of this information lies in the musical composition where well-defined language exists. However, a significant amount of information is added during a performance as the musician interprets the composition. The performer injects expressiveness into the written score through variations of different musical properties such as dynamics and tempo. In this paper, we describe a model that can learn to perform sheet music. Our research concludes that the generated performances are indistinguishable from a human performance, thereby passing a test in the spirit of a "musical Turing test".

研究动机与目标

  • 开发一种数据驱动的模型,无需依赖手工设计规则,即可从乐谱学习生成富有表现力的音乐演奏。
  • 探究神经网络是否能够学习并再现音乐演奏中的动态、表现性特征,如力度和时序。
  • 评估机器生成的演奏是否能在感知图灵测试中与人类演奏无法区分。
  • 探索将音乐风格作为与音乐内容分离的、可迁移的独立组件进行学习的可行性。
  • 创建一个公开可用的数据集(Piano数据集),以支持未来在神经网络音乐演奏合成方面的研究。

提出的方法

  • 该模型使用长短期记忆(LSTM)网络将音符音高的序列映射为预测的音符力度,从原始演奏数据中学习富有表现力的时序与动态特征。
  • 该架构采用回归设置进行训练,输入为音符触发时刻和音高的序列,输出为每个音符对应的力度值。
  • 模型在大规模MIDI演奏数据集上进行端到端训练,直接从乐谱中学习富有表现力的演奏特征。
  • 探索了两种变体:GenreNet用于特定流派的风格建模,StyleNet用于通用演奏合成。
  • 通过一系列人类感知实验对模型进行评估,包括在短片段和完整演奏中的音乐版图灵测试。
  • 未来工作中提出分层架构,以更好地解耦音乐内容与风格,目标是实现跨流派的风格迁移。

实验结果

研究问题

  • RQ1神经网络能否从乐谱学习生成在感知上与人类演奏无法区分的富有表现力的音乐演奏?
  • RQ2像LSTM这样的序列模型在多大程度上能够捕捉音乐表现中固有的长程依赖关系与动态变化?
  • RQ3该模型能否在未对风格标签进行显式监督的情况下,泛化到不同音乐风格(如古典与爵士)?
  • RQ4是否可能在神经网络模型中将音乐内容与风格分离,以实现在不同流派间的风格迁移?
  • RQ5当在完整乐曲上进行评估时,该模型在真实世界图灵测试环境下的表现如何?

主要发现

  • 在短片段图灵测试中,仅有46%的参与者能正确识别出人类演奏,表明生成的演奏与真实演奏无法区分。
  • 该模型在完整演奏的音乐图灵测试中表现成功,46%的参与者未能区分合成演奏与人类演奏。
  • 平均而言,53%的参与者能识别出短片段中的真实演奏,仅略高于50%的随机猜测基线,表明其具有极强的感知真实感。
  • 在‘识别风格’测试中,47.5%的参与者正确识别出流派(古典或爵士),仅略优于随机猜测,表明其生成鲜明风格特征的能力有限。
  • 结果表明,尽管该模型能生成高度逼真的演奏,但在生成清晰可分离的风格特征方面仍存在困难,说明其在建模流派特异性表现方面存在局限。
  • 作者得出结论:当前的模型架构不足以实现内容与风格的解耦,未来工作将聚焦于分层模型以实现更优的风格分解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。