Skip to main content
QUICK REVIEW

[论文解读] Learning Interpretable Representation for Controllable Polyphonic Music Generation

Ziyu Wang, Dingsu Wang|arXiv (Cornell University)|Aug 17, 2020
Music and Audio Processing参考文献 41被引用 20
一句话总结

本文提出一种基于VAE的模型,可将多声部音乐解耦为可解释的和弦与音色因子,通过潜在空间操作实现可控生成。通过引入基于规则的和弦识别与和弦不变卷积网络,该方法在风格迁移、音色变化和伴奏编排等应用中实现了高质量、可解释的音乐生成,部分风格迁移评估中甚至优于原始人类创作作品。

ABSTRACT

While deep generative models have become the leading methods for algorithmic composition, it remains a challenging problem to control the generation process because the latent variables of most deep-learning models lack good interpretability. Inspired by the content-style disentanglement idea, we design a novel architecture, under the VAE framework, that effectively learns two interpretable latent factors of polyphonic music: chord and texture. The current model focuses on learning 8-beat long piano composition segments. We show that such chord-texture disentanglement provides a controllable generation pathway leading to a wide spectrum of applications, including compositional style transfer, texture variation, and accompaniment arrangement. Both objective and subjective evaluations show that our method achieves a successful disentanglement and high quality controlled music generation.

研究动机与目标

  • 为解决深度生成音乐模型中潜在变量难以有意义控制的问题,提升其可解释性。
  • 在不依赖复杂、任务特定架构的前提下,实现对和声与音色等创作因素的精确控制。
  • 探究解耦的和弦(内容)与音色(风格)表征是否可作为多样化音乐生成任务的通用控制手段。
  • 通过客观指标与主观人类评估相结合的方式,评估解耦表征的有效性。

提出的方法

  • 采用VAE框架,并使用双分支编码器强制实现解耦:一个分支通过基于规则的和弦识别器,将和弦信息嵌入潜在空间的前半部分。
  • 第二个分支将音乐视为2D图像,应用和弦不变卷积网络,将节奏、轮廓、和弦排列等音色特征提取至潜在空间的后半部分。
  • 使用PianoTree VAE解码器架构,从解耦的潜在表征中分层重建多声部音乐。
  • 通过网络架构设计引入归纳偏置,而非依赖损失函数,确保解耦的鲁棒性,无需额外训练目标。
  • 通过潜在空间操作实现控制:编码向量交换、采样与条件预测,用于下游任务。
  • 利用分层的、分层的VAE基解码器,从解耦的潜在码中重建完整的8拍钢琴段落。

实验结果

研究问题

  • RQ1能否通过架构归纳偏置,在基于VAE的音乐生成模型潜在空间中有效解耦和弦与音色?
  • RQ2解耦的潜在因子在多大程度上能实现对风格迁移与音色变化等多样化任务的可控音乐生成?
  • RQ3客观评估与主观评估在生成音乐质量上的表现如何比较,特别是在风格迁移场景中?
  • RQ4在特定控制场景下,模型能否生成评分高于人类原创作品的音乐?

主要发现

  • 模型成功实现和弦与音色因子的解耦,客观指标显示:和弦表征对音高转位高度敏感,而音色表征对节奏变化响应强烈。
  • 主观评估中,表现最佳的风格迁移作品评分显著高于原始创作作品(p < 0.005),表明在某些情况下音乐性与创造力更优。
  • 平均而言,迁移作品评分低于原始作品,但最佳迁移作品在创造力与音乐性上均超越原始作品。
  • 通过交换潜在码,模型成功实现有效作曲风格迁移,证明音色可独立于和弦进行迁移。
  • 通过潜在分布采样实现的音色变化,成功模拟了“主题与变奏”结构,在保持和声结构的同时改变节奏与旋律轮廓。
  • 通过条件预测实现的伴奏编排展现出潜力,表明该模型可扩展为利用下游编码器-解码器结构,从旋律生成伴奏。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。