Skip to main content
QUICK REVIEW

[論文レビュー] Music Generation with Deep Learning

Vasanth Kalingeri, Srikanth Grandhe|arXiv (Cornell University)|Dec 15, 2016
Music and Audio Processing参考文献 2被引用数 7
ひとこと要約

この論文では、周波数ドメイン表現を用いた深層学習的手法を提案し、LSTMアーキテクチャに全結合層および畳み込み層を組み合わせることで、音声品質を向上させる、生の音声波形からの音楽生成を実現する。二重線形LSTMモデルは盲検テストにおいて最高の知覚的品質を達成し、楽譜や構造的なMIDIデータに依存せずに、一貫性があり快適な音楽を学習することで、ベースラインモデルを上回った。

ABSTRACT

The use of deep learning to solve problems in literary arts has been a recent trend that has gained a lot of attention and automated generation of music has been an active area. This project deals with the generation of music using raw audio files in the frequency domain relying on various LSTM architectures. Fully connected and convolutional layers are used along with LSTM's to capture rich features in the frequency domain and increase the quality of music generated. The work is focused on unconstrained music generation and uses no information about musical structure(notes or chords) to aid learning.The music generated from various architectures are compared using blind fold tests. Using the raw audio to train models is the direction to tapping the enormous amount of mp3 files that exist over the internet without requiring the manual effort to make structured MIDI files. Moreover, not all audio files can be represented with MIDI files making the study of these models an interesting prospect to the future of such models.

研究の動機と目的

  • 楽譜やMIDIファイルを一切使用せずに、生の音声波形から高品質で制約のない音楽を直接生成すること。
  • 追加の全結合層および畳み込み層を備えた深層LSTMアーキテクチャを用いて周波数ドメインで音声をモデル化することで、音楽生成の品質を向上させること。
  • 構造的正確性ではなく、音楽理論の正確性を基準としない知覚的品質に注目し、盲検聴取テストを通じてモデルの性能を評価すること。
  • 二重線形LSTMやマルチレイヤーLSTMアーキテクチャといったアーキテクチャ的改善が、長距離依存性の学習および音声の一貫性を向上させるかを同定すること。
  • 平均二乗誤差損失の代替として、将来の敵対的訓練を提案し、人間の知覚との整合性を高めること。

提案手法

  • 音声サンプルは、フーリエ変換を用いて時間領域の波形から8000次元の周波数ドメインベクトルに変換され、実部と虚部が連結される。
  • モデルは10秒の音声セグメントを学習し、1回の順伝播で10秒分の音声を処理するために、40ステップのコンテキストを用いる。
  • ベースモデルは周波数ドメイン入力に単一のLSTMを用いるが、強化されたモデルには全結合層、1次元および2次元畳み込み層、並列LSTMユニットを備えた二重線形LSTMアーキテクチャが含まれる。
  • 訓練にはRMSProp最適化手法を用い、学習率は0.0001、損失関数は平均二乗誤差を採用。正則化にはL2正則化とドロップアウト(全結合層では0.2、LSTMでは0.5)を適用。
  • 生成音声は1200、1500、1800、2100エポックごとにサンプリングされ、手動でのプルーニングと盲検テストに基づき、最も優れた性能を示すモデルが選別される。
  • 10名の被験者による盲検聴取テストで、1〜5段階のスケールで音声品質を評価し、異なるモデルから得られた30の生成クリップを用いて評価が行われる。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、楽譜やMIDIデータに依存せずに、生の音声波形から知覚的に快適な音楽を生成できるか?
  • RQ2全結合層、1次元/2次元畳み込み、二重線形LSTM構造といった、さまざまなアーキテクチャ的要素が、生成音声の品質および一貫性にどのように影響を与えるか?
  • RQ3訓練データが限られている状況下で、追加の層を追加することでモデル容量を拡大すると、音楽生成のパフォーマンスが向上するか?
  • RQ4ハードウェア制限によるセルサイズの制限がある中で、LSTMを用いた周波数ドメインモデリングが、一貫性のある音楽生成に必要な長距離依存性を捉えられるか?
  • RQ5平均二乗誤差のような損失関数の選択と、将来の敵対的損失との比較において、知覚的音声品質にどのような違いが生じるか?

主な発見

  • 二重線形LSTMモデルは盲検聴取テストで平均3.6(満点5点)の最高得点を記録し、ベースモデル(2.4)を著しく上回った。
  • 2次元畳み込みLSTMモデルは平均3.4で2位となり、周波数ドメインにおける空間的畳み込みが特徴の学習を向上させることを示した。
  • FC、1次元畳み込み、スタックドLSTMを含む、すべての提案モデルがベースモデルを上回り、平均得点は2.8から3.4の間で、アーキテクチャの強化による利点が明確に示された。
  • 二重線形LSTMは、より効率的な特徴抽出を可能にする並列学習パスのおかげで、他のモデルよりも速く収束し、より優れたパフォーマンスを達成した。
  • 訓練にピアノ録音を使用したにもかかわらず、モデルは電子的でインストルメンタルでない音楽を生成したため、元の楽器の特徴を超えた一般化が示された。
  • 訓練中の損失曲線は、すべてのモデルで類似しており、知覚的品質とは相関がなかった。これは、損失関数そのものが音声品質の妥当な代理指標ではないことを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。