Skip to main content
QUICK REVIEW

[論文レビュー] Long-form music generation with latent diffusion

Zach Evans, Julian D. Parker|arXiv (Cornell University)|Apr 16, 2024
Music Technology and Sound Studies被引用数 4
ひとこと要約

本論文では、21.5 Hzの高圧縮連続潜在表現上で動作する潜在拡散モデルを提示しており、4分45秒までの一貫性のある長尺音楽トラックを生成する。このモデルは意味的トークンに依存せず、音声品質とプロンプトの整合性において最先端の結果を達成し、構造的整合性の高いエンドツーエンドの長尺音楽生成を可能にする。

ABSTRACT

Audio-based generative models for music have seen great strides recently, but so far have not managed to produce full-length music tracks with coherent musical structure from text prompts. We show that by training a generative model on long temporal contexts it is possible to produce long-form music of up to 4m45s. Our model consists of a diffusion-transformer operating on a highly downsampled continuous latent representation (latent rate of 21.5Hz). It obtains state-of-the-art generations according to metrics on audio quality and prompt alignment, and subjective tests reveal that it produces full-length music with coherent structure.

研究の動機と目的

  • 既存のテキスト条件付き音楽生成モデルでは長期間の音楽的構造に欠けるため、それらは通常10〜90秒程度の短いセグメントしか生成しない。
  • 長期間の音楽的文脈を用いて学習することで、最大4分45秒までの完全な長尺音楽生成を実現する。
  • 意味的トークンに依存しないように、極めて圧縮された連続潜在空間における潜在拡散にのみ依存する。
  • 長尺音楽生成における音声品質とテキストプロンプトとの整合性において、最先端のパフォーマンスを達成する。
  • 1回の順伝播処理で構造的整合性のある長尺音楽を生成できることを示す。

提案手法

  • モデルは、44.1kHzステレオ波形を21.5 Hzの連続潜在空間に圧縮するための深層オートエンコーダーを用いる。これにより、系列長が著しく短縮される。
  • 拡散変換器(DiT)は潜在空間上で直接動作し、テキストとタイミングの条件付けにクロスアテンションを用い、拡散ステップに前置き条件付けを適用する。
  • テキスト条件付けは、CLAPベースの対照的音声・テキスト埋め込みモデルを用いて、テキストプロンプトと潜在表現との整合性を図る。
  • モデルは、最大285秒の完全な音楽トラック上でエンドツーエンドに学習され、自己回帰的または階層的な生成を必要とせず、完全な文脈での生成が可能になる。
  • 潜在空間は連続的かつ正規化されており、高精度な音声再構成と安定した拡散サンプリングを可能にする。
  • アーキテクチャは現代のGPU VRAMに最適化されており、4分45秒の生成でも13秒の推論時間で実現できる。
Figure 2 : Architecture of the diffusion-transformer (DiT). Cross-attention includes timing and text conditioning. Prepend conditioning includes timing conditioning and also the signal conditioning on the current timestep of the diffusion process.
Figure 2 : Architecture of the diffusion-transformer (DiT). Cross-attention includes timing and text conditioning. Prepend conditioning includes timing conditioning and also the signal conditioning on the current timestep of the diffusion process.

実験結果

リサーチクエスチョン

  • RQ1意味的トークンに依存せずに、4分45秒までの長尺音楽(構造的整合性を保ったまま)を潜在拡散モデルが生成できるか?
  • RQ2短いセグメントではなく、完全な長尺音楽文脈で学習することで、長期間の構造的整合性が向上するか?
  • RQ321.5 Hzという極めて低圧縮の潜在表現は、長期間の文脈生成を可能にしつつ、聴覚的音質を保持できるか?
  • RQ4最先端のベースラインと比較して、音声品質とプロンプト整合性の両面で、このモデルはどのように性能を発揮するか?
  • RQ5長尺音楽生成における記憶のリスクは何か?そして、体系的な分析によってそれらを軽減できるか?

主な発見

  • 主観的評価により、最大4分45秒の長尺音楽トラックが構造的整合性を保って生成されたことが確認された。
  • 音声品質とテキストプロンプト整合性の指標において、先行モデルを上回る最先端のパフォーマンスを達成した。
  • 21.5 Hzの潜在レートで高精細な音声を生成し、低時間分解能でも聴覚的品質が保持されることを示した。
  • 1枚のGPUで13秒の推論時間で、1回の順伝播処理で長尺音楽を効率的に生成できる。
  • 包括的な記憶分析の結果、5,566個の繰り返し訓練サンプルをテストしても、モデルの記憶の兆候は一切認められなかった。
  • 音声対音声スタイル変換、ボーカルに似たメロディ生成、短尺のサウンドエフェクト合成といった、追加の機能も有している。
Figure 3 : Architecture of the autoencoder.
Figure 3 : Architecture of the autoencoder.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。