Skip to main content
QUICK REVIEW

[論文レビュー] CRASH: Raw Audio Score-based Generative Modeling for Controllable High-resolution Drum Sound Synthesis

Simon Rouard, Gaëtan Hadjeres|arXiv (Cornell University)|Jun 14, 2021
Music and Audio Processing被引用数 6
ひとこと要約

CRASHは、確率的微分方程式(SDEs)とノイズ条件付きU-Netを用いて、スコア関数を推定するスコアベースの生成モデルを導入し、44.1 kHzの高分解能生波形ドラム音源を生成する。多様なサンプリング方式(例えば、ハイブリッド音色のためのクラスミキシングを含む)を用いて制御可能な生成を可能にし、FADスコアが最小0.98に達し、GANベースの手法との差を埋めつつ、より高い柔軟性と訓練効率を提供する。

ABSTRACT

In this paper, we propose a novel score-base generative model for unconditional raw audio synthesis. Our proposal builds upon the latest developments on diffusion process modeling with stochastic differential equations, which already demonstrated promising results on image generation. We motivate novel heuristics for the choice of the diffusion processes better suited for audio generation, and consider the use of a conditional U-Net to approximate the score function. While previous approaches on diffusion models on audio were mainly designed as speech vocoders in medium resolution, our method termed CRASH (Controllable Raw Audio Synthesis with High-resolution) allows us to generate short percussive sounds in 44.1kHz in a controllable way. Through extensive experiments, we showcase on a drum sound generation task the numerous sampling schemes offered by our method (unconditional generation, deterministic generation, inpainting, interpolation, variations, class-conditional sampling) and propose the class-mixing sampling, a novel way to generate "hybrid" sounds. Our proposed method closes the gap with GAN-based methods on raw audio, while offering more flexible generation capabilities with lighter and easier-to-train models.

研究の動機と目的

  • 既存のGANベースおよび拡散モデルベースの手法を上回る忠実度と柔軟性を備えた、制御可能で高分解能の生波形ドラム音源生成モデルの開発。
  • 元来画像分野で開発されたスコアベース生成モデリングを、音声データに適したSDEを用いて波形ドメインに適応化すること。
  • 確定的サンプリング、インpainting、補間、クラス条件付き生成を含む複数のサンプリング方式を通じたインタラクティブなサウンドデザインの実現。
  • 複数のクラスから得たトーン的特徴をブレンドすることで、ハイブリッドドラム音色を生成する、新たなクラスミキシングサンプリング手法の導入。
  • DDIMを用いた高速なリアルタイム超過の推論を可能にするSDEの再パrameter化を提供すること。

提案手法

  • モデルは、時間に依存するドリフト関数と拡散関数を用いて、連続時間の前向きSDEを用い、生波形を段階的にノイズで汚染する。
  • ノイズ条件付きU-Netを訓練し、ノイズが加わったデータの対数密度の勾配(スコア関数)を推定する。これにより、ODEソルバーを用いた逆方向のノイズ除去が可能になる。
  • 音声データに最適化された、特にサブ-VPコサインスケジュール(sub-VP cos schedule)を含む、新たなSDEスケジュールを提案。ゼロに近いノイズ領域に多くのステップを集中させることで、聴覚的品質を向上させる。
  • 数値的ODE統合によりサンプリングを実行し、DDIMスキームをSDEの特定の離散化と再解釈することで、高速かつ確定的な推論を実現する。
  • クラス条件付き生成は、ドラムクラスラベル上で別個に訓練された分類器を用い、逆方向ODEプロセスをガイドすることで実現する。
  • クラスミキシングサンプリング戦略として、異なるクラス条件付き分布間の潜在変数を補間することで、例えば「スネア特徴を持つキック」のようなハイブリッド音色を生成する。

実験結果

リサーチクエスチョン

  • RQ1スコアベース生成モデリングをSDEを用いて、特に打撃音に適した高分解能生波形生成に効果的に適応できるか?
  • RQ2音声データにおいて、聴覚的品質とサンプル多様性の観点から、どのSDEスケジュールが最も効果的か?
  • RQ3ノイズ条件付きU-Netは、44.1 kHzの生波形波形のスコア関数を効果的に推定できるか?
  • RQ4確定的、確率的、インpainting、補間といった複数のサンプリング方式が、実際のサウンドデザインの場面でどのように機能するか?
  • RQ5新規のクラスミキシングサンプリング手法は、従来の合成では容易に得られない音楽的に意味のあるハイブリッドドラム音色を生成できるか?

主な発見

  • サブ-VPコサインスケジュールがテストセットでFADスコア0.98を達成し、他のスケジュールを上回り、優れた聴覚的品質を示した。
  • DDIMサンプリングスキームをSDEの離散化と再解釈することで、リアルタイムを超える高速な推論が可能となり、実時間でのサウンドデザインに実用的となった。
  • モデルは高忠実度の44.1 kHzドラム音源生成を達成し、再構築されたサンプルは正確なトーン的特徴とトランジェント特性を示した。
  • クラスミキシングサンプリングは、例えばシンバルをキックに変換したり、キックにスネア特徴を加えたようなハイブリッド音色の生成に成功し、制御可能なトーンブレンドを実証した。
  • スネア音の末尾部分に対してインpaintingを実行したところ、複数の妥当なバリエーションが再生され、モデルのターゲット指定型音声編集能力を示した。
  • 良好なサンプル品質にもかかわらず、非条件生成では元のデータセットに比べてやや多様性が低下しており、潜在空間カバレッジの向上に余地があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。