Skip to main content
QUICK REVIEW

[论文解读] Generative Modelling for Controllable Audio Synthesis of Expressive Piano Performance

Hao Tan, Yin-Jyun Luo|arXiv (Cornell University)|Jun 16, 2020
Music and Audio Processing参考文献 11被引用 4
一句话总结

本文提出了一种基于高斯混合变分自编码器(GM-VAE)的可控神经音频合成器,能够从击键时序图生成富有表现力的钢琴演奏,通过条件化音符连贯性与强弱的潜在变量,实现在时间维度上的精细风格渐变。该模型实现了连奏/断奏以及强音/弱音风格之间的平滑过渡,同时可通过从参考音频中推理风格因子实现演奏风格迁移。

ABSTRACT

We present a controllable neural audio synthesizer based on Gaussian Mixture Variational Autoencoders (GM-VAE), which can generate realistic piano performances in the audio domain that closely follows temporal conditions of two essential style features for piano performances: articulation and dynamics. We demonstrate how the model is able to apply fine-grained style morphing over the course of synthesizing the audio. This is based on conditions which are latent variables that can be sampled from the prior or inferred from other pieces. One of the envisioned use cases is to inspire creative and brand new interpretations for existing pieces of piano music.

研究动机与目标

  • 开发一种神经音频合成器,能够直接从MIDI击键时序图生成逼真的钢琴演奏,无需依赖帧级或力度级MIDI数据。
  • 实现在音频域中对连贯性与强弱等富有表现力的演奏特征进行细粒度、可控的操纵。
  • 通过在潜在空间中解耦富有表现力的特征,支持渐进式风格渐变与演奏风格迁移等创意应用。
  • 克服传统合成方法依赖拼接音符采样或固定钢琴模拟所带来的局限性。

提出的方法

  • 模型采用条件变分自编码器(VAE)框架,并在两个潜在空间上使用高斯混合先验:一个用于连贯性(连奏/断奏),一个用于强弱(强音/弱音),实现解耦控制。
  • 潜在变量基于从音频数据中提取的二值化风格序列进行条件化:连贯性使用击键持续时间,强弱使用平均力度值。
  • 生成网络采用两层双向LSTM,从击键时序图和风格条件化的潜在向量合成梅尔频谱图。
  • 推理网络从参考音频中估计潜在风格表征,从而通过将风格从参考作品中迁移实现演奏风格迁移。
  • 联合损失函数优化重建损失、相对于混合先验的KL散度,以及用于风格预测的附加交叉熵损失。
  • 使用WaveGlow将生成的梅尔频谱图反演为高保真音频,确保快速且高质量的推理。

实验结果

研究问题

  • RQ1生成模型是否能在音频域中实现对连贯性与强弱等富有表现力的钢琴演奏特征的细粒度、连续控制?
  • RQ2潜在表征应如何构建,以实现在时间维度上不同演奏风格之间的平滑渐变?
  • RQ3模型在多大程度上能够将一首作品的富有表现力的风格迁移至另一首作品,同时保持原始音乐内容不变?
  • RQ4该模型是否能够在无需完整力度或帧级MIDI输入的情况下生成逼真的音频演奏?

主要发现

  • 模型仅依赖击键时序图即可成功生成逼真的钢琴演奏,实现了高感知质量,且无需完整MIDI力度或帧信息。
  • 通过在连贯性潜在空间中进行线性插值,实现了从断奏到连奏的渐进式风格渐变,表现为音符持续时间随时间逐渐延长。
  • 同样地,从弱音到强音的渐变导致振幅和高频能量逐渐增加,听觉上感知为更大的音量能量。
  • 演奏风格迁移效果显著:巴洛克时期的作品可被以浪漫派风格重新演绎,且准确传递了音符持续时间与动态变化特征。
  • 在风格迁移过程中,原始音乐内容得到良好保留,经对齐的钢琴时序图与梅尔频谱图显示一致的音符起始时刻与音高内容。
  • 使用高斯混合先验使富有表现力特征的控制实现了解耦与可解释性,支持对新演奏诠释的创造性探索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。