Skip to main content
QUICK REVIEW

[论文解读] CRASH: Raw Audio Score-based Generative Modeling for Controllable High-resolution Drum Sound Synthesis

Simon Rouard, Gaëtan Hadjeres|arXiv (Cornell University)|Jun 14, 2021
Music and Audio Processing被引用 6
一句话总结

CRASH 提出了一种基于分数的生成模型,用于高分辨率(44.1 kHz)原始音频鼓音色合成,采用随机微分方程(SDEs)和噪声条件U-Net来估计分数函数。该方法通过多种采样方案(包括用于混合音色的类别混合)实现可控生成,FAD得分最低达到0.98,显著缩小了与基于GAN的方法之间的差距,同时具备更高的灵活性和训练效率。

ABSTRACT

In this paper, we propose a novel score-base generative model for unconditional raw audio synthesis. Our proposal builds upon the latest developments on diffusion process modeling with stochastic differential equations, which already demonstrated promising results on image generation. We motivate novel heuristics for the choice of the diffusion processes better suited for audio generation, and consider the use of a conditional U-Net to approximate the score function. While previous approaches on diffusion models on audio were mainly designed as speech vocoders in medium resolution, our method termed CRASH (Controllable Raw Audio Synthesis with High-resolution) allows us to generate short percussive sounds in 44.1kHz in a controllable way. Through extensive experiments, we showcase on a drum sound generation task the numerous sampling schemes offered by our method (unconditional generation, deterministic generation, inpainting, interpolation, variations, class-conditional sampling) and propose the class-mixing sampling, a novel way to generate "hybrid" sounds. Our proposed method closes the gap with GAN-based methods on raw audio, while offering more flexible generation capabilities with lighter and easier-to-train models.

研究动机与目标

  • 开发一种可控的、高分辨率原始音频生成模型,用于鼓音色,其保真度和灵活性超越现有的基于GAN和扩散模型的方法。
  • 将原本为图像设计的基于分数的生成建模方法,适配至波形域,并为音频数据设计定制化的SDE。
  • 通过多种采样方案(包括确定性采样、修复、插值和类别条件生成)实现交互式音色设计。
  • 提出一种新颖的类别混合采样方法,通过混合多个类别的音色特征,生成具有混合特性的鼓音色。
  • 对SDE进行重参数化,通过DDIM实现超实时采样,提升推理效率。

提出的方法

  • 模型使用连续时间前向SDE,通过时间依赖的漂移和扩散函数,逐步向原始音频波形添加噪声。
  • 训练一个噪声条件U-Net来估计分数函数(即噪声数据对数密度的梯度),从而通过求解常微分方程(ODE)实现反向去噪。
  • 作者提出了新型SDE调度方案——特别是sub-VP cos调度——通过在接近零噪声时集中更多步数,优化音频数据,提升感知质量。
  • 通过数值ODE积分执行采样,将DDIM方案重新解释为SDE的一种特定离散化方式,实现快速、确定性的推理。
  • 通过在鼓类标签上训练独立分类器,实现类别条件生成,并用于引导反向ODE过程。
  • 提出一种类别混合采样策略,通过在不同类别条件分布的潜在码之间进行插值,生成如“具有军鼓特征的Kick”等混合音色。

实验结果

研究问题

  • RQ1基于分数的生成建模结合SDE是否能有效应用于高分辨率原始音频生成,特别是打击乐声音?
  • RQ2哪些SDE调度方案在音频数据上表现最佳,特别是在感知质量和样本多样性方面?
  • RQ3噪声条件U-Net能否有效估计44.1 kHz原始音频波形的分数函数?
  • RQ4在实际音色设计场景中,不同采样方案(确定性、随机、修复、插值)的表现如何?
  • RQ5新颖的类别混合采样方法能否生成在音乐上具有意义的混合鼓音色,而这些音色难以通过传统合成方法实现?

主要发现

  • sub-VP cos调度在测试集上实现了最低的FAD得分0.98,优于其他调度方案,表明其具有更优的感知质量。
  • 当DDIM采样方案被重新解释为SDE的离散化时,实现了超实时推理,使其在实时音色设计中具备实用性。
  • 模型实现了高保真度的44.1 kHz鼓音色生成,重建样本准确再现了音色特征和瞬态响应。
  • 类别混合采样成功生成了混合鼓音色,如将 cymbal 转换为 kick 或使 kick 更具 snare 特性,展示了可控的音色融合能力。
  • 对 snare 音色尾部的修复采样成功再生了多种合理的变化,展示了模型在目标音频编辑方面的能力。
  • 尽管样本质量良好,无条件生成的多样性略低于原始数据集,表明潜在空间覆盖仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。