Skip to main content
QUICK REVIEW

[論文レビュー] Musika! Fast Infinite Waveform Music Generation

Marco Pasini, Jan Schlüter|arXiv (Cornell University)|Aug 18, 2022
Music Technology and Sound Studies被引用数 5
ひとこと要約

Musikaは、1台のコンsumer GPUで学習し、CPU推論で実行する非自己回帰的でGANベースの音楽生成システムを導入しており、高速でユーザー制御可能かつ無限長の生音声生成を実現する。これは、音声を低次元の潜在表現に圧縮する階層的可逆オートエンコーダー、無限長生成に適した潜在座標系、長期的な一貫性を保証するグローバルスタイル条件付き入力を用いることで達成される。ピアノ音楽において、速度とFADスコアの両面で先行研究を上回っている。

ABSTRACT

Fast and user-controllable music generation could enable novel ways of composing or performing music. However, state-of-the-art music generation systems require large amounts of data and computational resources for training, and are slow at inference. This makes them impractical for real-time interactive use. In this work, we introduce Musika, a music generation system that can be trained on hundreds of hours of music using a single consumer GPU, and that allows for much faster than real-time generation of music of arbitrary length on a consumer CPU. We achieve this by first learning a compact invertible representation of spectrogram magnitudes and phases with adversarial autoencoders, then training a Generative Adversarial Network (GAN) on this representation for a particular music domain. A latent coordinate system enables generating arbitrarily long sequences of excerpts in parallel, while a global context vector allows the music to remain stylistically coherent through time. We perform quantitative evaluations to assess the quality of the generated samples and showcase options for user control in piano and techno music generation. We release the source code and pretrained autoencoder weights at github.com/marcoppasini/musika, such that a GAN can be trained on a new music domain with a single GPU in a matter of hours.

研究の動機と目的

  • 音楽生成における自己回帰的モデルの限界、すなわち推論が遅く、計算コストが高いために解決を図ること。
  • 非自己回帰的システムにおける長距離の一貫性の欠如と固定長生成の制限を克服すること。
  • コンsumerハードウェア上で任意長の高速な無条件および条件付き音声生成を実現すること。
  • 最小限のリソースで新しい音楽ドメインの学習が可能なフレームワークを提供すること。そのために事前学習済みの汎用オートエンコーダーを活用すること。
  • ノート密度やテンポといった条件付き信号によるユーザー制御を提供し、インタラクティブな音楽制作を可能にすること。

提案手法

  • 生音声を可逆的かつ低次元の潜在表現に圧縮する二段階の階層的オートエンコーダーを用い、時間解像度を低減する。
  • オートエンコーダーに敵対的訓練を適用することで、再構成品質を向上させ、効率的な推論を可能にする。
  • 潜在座標系により、潜在ベクトルを連続的かつ構造的な空間にモデル化することで、任意長の音声シーケンスを並列に生成可能にする。
  • 長期的な一貫性を維持するため、グローバルスタイル条件付きベクトルを導入する。
  • 潜在表現上でGANを訓練し、新しいシーケンスを生成する。無条件および条件付きの両バージョンを用いる。
  • ノート密度(オンセットにカーネル密度推定を適用)およびテンポ(テンポ-CNNを介して)といった条件付き信号を用いて生成を制御する。

実験結果

リサーチクエスチョン

  • RQ1非自己回帰的でGANベースのシステムは、コンsumer CPU上でリアルタイムより高速な推論速度で、高品質で無限長の生音声を生成できるか?
  • RQ2敵対的訓練を施した階層的オートエンコーダーは、音声品質を保持しつつ、高速な学習と推論を実現できるか?
  • RQ3潜在座標系により、一貫性を失わず、任意長の音声シーケンスを生成できるか?
  • RQ4グローバルスタイル条件付き入力により、生成音楽における長期的なスタイルの一貫性を確保できるか?
  • RQ5ノート密度やテンポといったユーザー制御可能な条件付き信号は、生成プロセスを効果的にガイドできるか?

主な発見

  • Musikaは、コンsumer CPU上でリアルタイムより高速な生成速度を達成しており、1秒あたりの音声生成に1秒未満の推論時間を要する。
  • 1台のコンsumer GPUを用いて数時間の学習で、数百時間分の音楽データを学習可能であり、学習は数時間で完了する。
  • MAESTROデータセットにおいて、無条件MusikaモデルはUNAGANを上回る低いFrechet Audio Distance(FAD)スコアを達成しており、音声品質が優れていることが示された。
  • 条件付きモデルは、ノート密度やテンポといった入力信号に整合した音楽を効果的に生成しており、聴取評価および視覚的検査によって妥当性が確認された。
  • 汎用オートエンコーダーの使用により、新しい音楽ジャンル(例:テクノ)のためのドメイン固有のGANを、オートエンコーダーの再学習なしに学習可能となり、学習時間とリソースの消費が削減された。
  • 公開済みの音声サンプルから観察されるように、生成されたサンプルは長時間にわたり一貫性のある音楽的スタイルと長距離の一貫性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。