Skip to main content
QUICK REVIEW

[论文解读] Maximum entropy models for generation of expressive music

Simon Moulieras, François Pachet|arXiv (Cornell University)|Oct 12, 2016
Music Technology and Sound Studies参考文献 10被引用 3
一句话总结

本文提出一种最大熵(MaxEnt)模型,通过学习专业钢琴家演奏爵士、流行及拉丁爵士音乐时的微时序偏差、时值偏移、动态变化及强拍位置,生成富有表现力的音乐。该模型捕捉了相邻音符之间的局部相关性,生成的音乐在听觉测试中与人类演奏在统计上无法区分,且参与者显著偏好MaxEnt生成的旋律,而非无表现力或随机表现力的版本。

ABSTRACT

In the context of contemporary monophonic music, expression can be seen as the difference between a musical performance and its symbolic representation, i.e. a musical score. In this paper, we show how Maximum Entropy (MaxEnt) models can be used to generate musical expression in order to mimic a human performance. As a training corpus, we had a professional pianist play about 150 melodies of jazz, pop, and latin jazz. The results show a good predictive power, validating the choice of our model. Additionally, we set up a listening test whose results reveal that on average, people significantly prefer the melodies generated by the MaxEnt model than the ones without any expression, or with fully random expression. Furthermore, in some cases, MaxEnt melodies are almost as popular as the human performed ones.

研究动机与目标

  • 通过基于原则的概率框架,将音乐表现力建模为对乐谱符号的偏离。
  • 捕捉音符层面表现参数(时序、时值、动态、强拍位置)之间的局部、平移不变相关性。
  • 开发一种生成模型,模仿人类演奏,而无需依赖全局结构模式。
  • 通过受控听觉测试评估生成音乐的感知质量。
  • 证明MaxEnt模型能够生成与人类演奏在听觉偏好上接近的表现力音乐。

提出的方法

  • 应用最大熵原理,构建在性能数据观测约束下熵最大的概率分布。
  • 对离散变量(如强拍位置)和连续变量(如起音偏差、时值偏差、动态)分别使用指数族形式的MaxEnt分布进行建模。
  • 使用局部、平移不变特征——每个音符的表现参数仅依赖于其直接相邻音符——从而施加局部纹理假设。
  • 定义充分统计量(可观测量),如起音偏差、时值偏差、动态和强拍位置,以捕捉相关的表现特征。
  • 通过最大似然估计,利用包含爵士、流行及拉丁爵士风格共150首专业演奏旋律的语料库估计模型参数。
  • 通过从学习到的MaxEnt分布中采样生成新演奏,保留相邻音符之间的统计依赖关系。

实验结果

研究问题

  • RQ1最大熵模型能否有效捕捉并从真实世界数据中生成富有表现力的音乐演奏?
  • RQ2相邻音符之间的局部相关性在多大程度上解释了当代音乐中的表现性时序与动态?
  • RQ3MaxEnt生成的演奏与人类演奏在感知上有多相似,尤其是与无表现力或完全随机表现力的版本相比?
  • RQ4该模型能否在爵士、流行及拉丁爵士等多样音乐风格间实现泛化?
  • RQ5听众对MaxEnt生成音乐与人类演奏的相对偏好如何?

主要发现

  • MaxEnt模型在训练数据上表现出强大的预测能力,验证了其捕捉显著表现性模式的能力。
  • 在听觉测试中,参与者显著偏好MaxEnt生成的旋律,优于无表现力版本和完全随机的表现力版本。
  • 在某些情况下,MaxEnt生成的旋律几乎与原始人类演奏一样受欢迎,表明其具有高度的感知合理性。
  • 该模型成功捕捉了局部表现性相关性,而无需依赖长程结构假设,支持了表现力主要源于局部纹理的假设。
  • 在MaxEnt框架中使用连续变量(起音、时值、动态)能够准确建模真实演奏中的微时序偏差。
  • 平移不变假设——即表现特征仅依赖于局部上下文——被证明在生成逼真音乐表现力方面有效且充分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。