Skip to main content
QUICK REVIEW

[论文解读] SurpriseNet: Melody Harmonization Conditioning on User-controlled Surprise Contours

Yi-Wei Chen, Hung-Shin Lee|arXiv (Cornell University)|Aug 1, 2021
Music and Audio Processing参考文献 33被引用 5
一句话总结

SurpriseNet 是一种条件变分自编码器(CVAE),通过基于马尔可夫链转移概率推导出的用户定义的惊喜轮廓,生成和声进行。它在给定与生成的惊喜轮廓之间实现了较强的对齐(Spearman等级相关系数 ρ = 0.517,p < 0.001),实现了用户可控、多样化且音乐上连贯的旋律和声生成,并扩展了和弦空间(共 633 种类型)。

ABSTRACT

The surprisingness of a song is an essential and seemingly subjective factor in determining whether the listener likes it. With the help of information theory, it can be described as the transition probability of a music sequence modeled as a Markov chain. In this study, we introduce the concept of deriving entropy variations over time, so that the surprise contour of each chord sequence can be extracted. Based on this, we propose a user-controllable framework that uses a conditional variational autoencoder (CVAE) to harmonize the melody based on the given chord surprise indication. Through explicit conditions, the model can randomly generate various and harmonic chord progressions for a melody, and the Spearman's correlation and p-value significance show that the resulting chord progressions match the given surprise contour quite well. The vanilla CVAE model was evaluated in a basic melody harmonization task (no surprise control) in terms of six objective metrics. The results of experiments on the Hooktheory Lead Sheet Dataset show that our model achieves performance comparable to the state-of-the-art melody harmonization model.

研究动机与目标

  • 通过在生成过程中融入主观音乐特质(如惊喜感),实现用户可控的旋律和声生成。
  • 利用信息论方法,将音乐惊喜建模为时间变化的轮廓,具体为一阶马尔可夫链中转移概率的负对数。
  • 开发一种条件变分自编码器框架,联合依赖旋律和用户指定的惊喜轮廓,实现富有表现力的和弦生成。
  • 将和弦空间从标准三和弦扩展至包含延展和弦与 alterations(如七和弦、九和弦、十一和弦、十三和弦、斜线和弦),以增强和声多样性。
  • 评估模型生成的和弦进行在旋律连贯性与用户定义的惊喜动态之间匹配的能力。

提出的方法

  • 将音乐惊喜建模为一阶马尔可夫链中和弦序列转移概率的负对数,生成随时间变化的惊喜轮廓。
  • 使用联合依赖旋律和惊喜轮廓的条件变分自编码器(CVAE),学习和弦进行的潜在表征。
  • 通过从拼接的旋律、惊喜轮廓和潜在变量中重建和弦序列来训练模型,采用重参数化技巧实现端到端优化。
  • 推理阶段,从潜在空间的标准正态先验中采样,同时依赖旋律和惊喜轮廓,生成多样化且连贯的和弦进行。
  • 通过整合 Hooktheory 乐谱数据集中所有和弦类型,将和弦词汇量从 96 种扩展至 633 种。
  • 在变体模型(加权 SurpriseNet)中应用类别加权损失,以鼓励多样性,但发现其相比标准 SurpriseNet 降低了轮廓保真度。

实验结果

研究问题

  • RQ1深度生成模型能否有效学习生成与用户指定的惊喜轮廓一致的和弦进行,同时保持与旋律的和声连贯性?
  • RQ2模型生成的惊喜动态与用户提供的惊喜轮廓之间的相关性如何?何种度量最能捕捉这种对齐?
  • RQ3将和弦空间扩展至包含延展和弦与 alterations 是否能提升生成进行的表达力与多样性,而不损害和声质量?
  • RQ4在损失函数中引入类别权重,如何影响模型遵循惊喜轮廓的能力,以及生成稀有或复杂和弦的倾向?
  • RQ5基于 CVAE 的框架能否在自动旋律和声中成功平衡用户控制(惊喜轮廓)与音乐连贯性(旋律兼容性)?

主要发现

  • SurpriseNet 在用户定义的惊喜轮廓与生成和弦进行中的惊喜动态之间实现了皮尔逊等级相关系数 ρ = 0.517(p < 0.001)的强相关性,表明两者高度对齐。
  • 原始 CVAE 模型在六项客观度量上与最先进旋律和声模型 [3] 表现相当,验证了其生成质量。
  • 加权 SurpriseNet 的相关性较低(ρ = 0.406),且表现出对复杂或稀有和弦的过度使用倾向,表明类别加权可能破坏轮廓保真度。
  • 生成的和弦进行始终遵循惊喜轮廓的时间结构,和弦变化频率的显著变化与预期模式一致(如歌曲中段出现惊喜峰值)。
  • 该模型能成功生成多样化、和声连贯且节奏协调的进行,适用于多种类型的惊喜轮廓,包括正常型、倒正态型和 S 型。
  • 扩展后的和弦空间(633 种类型)使模型能够生成丰富、富有表现力的进行,包括七和弦、九和弦、十一和弦、十三和弦及斜线和弦,显著提升了音乐表现力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。