Skip to main content
QUICK REVIEW

[論文レビュー] Multi-instrument Music Synthesis with Spectrogram Diffusion

Curtis Hawthorne, Ian Simon|arXiv (Cornell University)|Jun 11, 2022
Music and Audio Processing被引用数 15
ひとこと要約

本論文では、MIDIシーケンスを高品位なオーディオに変換し、ノートレベルの完全な制御を可能にする、リアルタイムでマルチインストルメント音楽合成を行うシステムを提案する。変数の変換器に基づくMIDIからスペクトログラムへのデコーダーを、ノイズ除去拡散確率モデル(DDPM)で訓練し、GANベースのスペクトログラムインバーターと組み合わせることで、自己回帰的ベースラインと比較して優れた音質とセグメント境界における時間的整合性を達成した。

ABSTRACT

An ideal music synthesizer should be both interactive and expressive, generating high-fidelity audio in realtime for arbitrary combinations of instruments and notes. Recent neural synthesizers have exhibited a tradeoff between domain-specific models that offer detailed control of only specific instruments, or raw waveform models that can train on any music but with minimal control and slow generation. In this work, we focus on a middle ground of neural synthesizers that can generate audio from MIDI sequences with arbitrary combinations of instruments in realtime. This enables training on a wide range of transcription datasets with a single model, which in turn offers note-level control of composition and instrumentation across a wide range of instruments. We use a simple two-stage process: MIDI to spectrograms with an encoder-decoder Transformer, then spectrograms to audio with a generative adversarial network (GAN) spectrogram inverter. We compare training the decoder as an autoregressive model and as a Denoising Diffusion Probabilistic Model (DDPM) and find that the DDPM approach is superior both qualitatively and as measured by audio reconstruction and Fréchet distance metrics. Given the interactivity and generality of this approach, we find this to be a promising first step towards interactive and expressive neural synthesis for arbitrary combinations of instruments and notes.

研究の動機と目的

  • 任意のインストルメントとノートの組み合わせに対して、高品位なオーディオを生成できるリアルタイムでインタラクティブなニューラルシンセサイザーの開発。
  • 一般的でデータ効率の良いアーキテクチャを用いることで、既存のニューラルシンセサイザーにおける制御性と汎用性のトレードオフを克服すること。
  • 自己回帰的デコーディングの代わりに拡散モデリングを採用することで、スペクトログラムベースの合成における音質と時間的整合性を向上させること。
  • 事前に生成されたスペクトログラムに条件付けたコンテキストに依存することで、セグメント境界にわたる一貫性あるオーディオ生成を実現すること。
  • 実音源と合成データを含む多様なペアド音声/MIDIデータセットに一度の学習で、実世界の録音、たとえばフレットノイズやバイブラートのような繊細なアーティキュレーションに対しても一般化可能なモデルの実現可能性を示すこと。

提案手法

  • 本モデルは二段階のパイプラインを採用:まず、変数の変換器エンコーダ・デコーダがMIDIノートイベントをスペクトログラムに変換し、デコーダーはノイズ除去拡散確率モデル(DDPM)として訓練される。
  • DDPMデコーダーは繰り返しガウスノイズをノイズ除去することで高品位なスペクトログラムを生成し、フレーム単位の自己回帰的デコーディングよりも品質が向上する。
  • 5秒のオーディオセグメント間での時間的連続性を確保するため、2番目のエンコーダースタックが直前に生成されたセグメントのスペクトログラムに条件づけてデコーダーを制御する。
  • 推論時、生成されたスペクトログラムはMelGANに類似したGANベースのボコーダーを用いて波形に逆変換される。
  • モデルは、実音源(例:Guitarset, URMP)と合成データを含む広範なペアド音声/MIDIデータセットで訓練され、インストルメントや音響的状況の多様性に一般化可能である。
  • 追加のコンテキスト入力に対応するため、モデル容量を拡大して「ベース」アーキテクチャにスケーリングし、境界アーチファクトを低減させ、音質を向上させた。

実験結果

リサーチクエスチョン

  • RQ11つの汎用的で変数の変換器ベースのモデルが、MIDI入力から任意のインストルメントの組み合わせに対して高品位なオーディオを効果的に合成できるか?
  • RQ2スペクトログラムデコーダーをDDPMで訓練することで、音質と知覚的整合性の面で自己回帰的デコーディングを上回るか?
  • RQ3直前のスペクトログラムセグメントに条件づけることで、継続的なオーディオ生成におけるセグメント境界の聴取可能なアーチファクトを効果的に排除できるか?
  • RQ4多様なデータセットに一度の学習で訓練された統合モデルが、実世界の録音、特にフレットノイズやバイブラートのような繊細なアーティキュレーションに対し、どの程度一般化できるか?
  • RQ5標準的な指標(Fréchet Audio DistanceとTranscription F1)を用いて、本モデルの性能が自己回帰的ベースラインと定量的に比較してどの程度優れているか?

主な発見

  • DDPMベースのデコーダーは、定性的および定量的評価の両方で自己回帰的ベースラインを上回り、最高のFréchet Audio Distance(FAD)とTranscription F1スコアを達成した。
  • 直前のスペクトログラムに条件づけることで、セグメント境界のアーチファクトが完全に除去され、長時間のオーディオ生成における時間的整合性が顕著に向上した。
  • 検証セットでは、Transcription F1スコアがほぼ1.0に達し、ターゲットスペクトログラムのほぼ完全な再構成を示したが、音声の品位は生波形の品質には及ばなかった。
  • 本モデルは、ギターレコーディングにおける自然なフレットノイズやオーケストラ楽器におけるバイブラートといった自然なアーティキュレーションを、速度やアーティキュレーションの明示的条件なしに合成できた。
  • スペクトログラムの逆変換ステップを用いながらも、モデルはわずかにリアルタイムより速く推論可能であり、インタラクティブなアプリケーションに適していた。
  • 検証セットでは過学習が観察されず、より大きなモデルを用いることで音質をさらに向上できる可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。