Skip to main content
QUICK REVIEW

[論文レビュー] Can GAN originate new electronic dance music genres? -- Generating novel rhythm patterns using GAN with Genre Ambiguity Loss

Nao Tokui|arXiv (Cornell University)|Nov 25, 2020
Music and Audio Processing参考文献 16被引用数 5
ひとこと要約

本論文では、トレーニングデータに含まれないどのジャンルにも属しない、新しいエレクトロニックス・ダンス・ミュージック(EDM)のリズムパターンを生成する拡張型GANフレームワーク「Creative-GAN」を提案する。2番目の識別器を通じてジャンルの曖昧さ損失を導入することで、ジェネレータはスタイル的に明確に異なるが音楽的に整合性のあるリズムパターンを生成するようインcentivizedされる。これは、GANが模倣を超えてまったく新しい音楽ジャンルを生み出す可能性を示している。

ABSTRACT

Since the introduction of deep learning, researchers have proposed content generation systems using deep learning and proved that they are competent to generate convincing content and artistic output, including music. However, one can argue that these deep learning-based systems imitate and reproduce the patterns inherent within what humans have created, instead of generating something new and creative. This paper focuses on music generation, especially rhythm patterns of electronic dance music, and discusses if we can use deep learning to generate novel rhythms, interesting patterns not found in the training dataset. We extend the framework of Generative Adversarial Networks(GAN) and encourage it to diverge from the dataset's inherent distributions by adding additional classifiers to the framework. The paper shows that our proposed GAN can generate rhythm patterns that sound like music rhythms but do not belong to any genres in the training dataset. The source code, generated rhythm patterns, and a supplementary plugin software for a popular Digital Audio Workstation software are available on our website.

研究の動機と目的

  • GANが、トレーニングデータに存在する既知のエレクトロニックス・ダンス・ミュージック・ジャンルに属さない、かつ現実的でかつスタイル的に新しいリズムパターンを生成できるかどうかを調査すること。
  • 標準GANの既存のジャンル分布からの逸脱を促すように訓練目的を変更することで、真正にオリジナルなコンテンツを生成する能力の制限を克服すること。
  • 実時間でのリズム生成が可能なDAWプラグインにトレーニング済みモデルを統合することで、音楽プロデューサー向けの実用的ツールを開発すること。
  • マイクロティミングの役割が、生成されたリズムの表現力や「グルーヴ感」をどのように向上させるかを検討し、将来的なモデル拡張の可能性を示唆すること。

提案手法

  • 標準GANフレームワークを拡張し、生成されたリズムパターンのジャンルを分類するための第2の識別器 $D_{\text{genre}}$ を導入する。
  • 高信頼度のジャンル予測をペナルティ化する「ジャンルの曖昧さ損失」項を導入し、ジャンル分類出力が一様分布(すなわち曖昧)になるように最小化する。
  • 実/偽識別器 ($D_r$) とジャンル分類器 ($D_{\text{genre}}$) の両方をだませるようにジェネレータを敵対的に訓練し、敵対的損失とジャンルの曖昧さ損失を含む組み合わせ損失関数を用いる。
  • 特定のジャンル的特徴を持つリズムパターンの条件付き生成を可能にするために、ジェネレータへの入力としてワンホットエンコードされたジャンルラベルを用いる。
  • リズムパターンを16分音符解像度のバイナリオンセット行列として表現し、複数のジャンルをカバーする多様なエレクトロニックス・ダンス・ミュージック・リズムデータセット上でモデルをトレーニングする。
  • TensorFlow.jsを用いてMax for Liveプラグインを実装し、事前にトレーニングされたジェネレータをデプロイすることで、Ableton Live内でのリアルタイムリズムパターン生成を可能にする。

実験結果

リサーチクエスチョン

  • RQ1GANベースのモデルは、トレーニングデータに存在する既知のエレクトロニックス・ダンス・ミュージック・ジャンルのいずれにも属さないが、音楽的に整合性のあるリズムパターンを生成できるか?
  • RQ2第2の識別器を通じてジャンルの曖昧さを強制することで、ジェネレータはリズム空間における未開拓のスタイル的領域を探索するよう促されるか?
  • RQ3生成されたリズムの統計的性質は、実際のトレーニングデータと比較してどのように異なるか。特にオンセット分布とリズム的複雑さの観点から検証する。
  • RQ4明示的なノベルティに関するスーパービジョンなしに生成されたリズムパターンが、人間の聴取者から「新奇で創造的」として認識されるか?
  • RQ5マイクロティミング情報は、生成されたリズムのリアリズムと表現力の両方をどの程度向上させるか。また、GANフレームワークにどのように統合できるか?

主な発見

  • Creative-GANモデルは、トレーニングデータに含まれるすべてのジャンルと統計的に異なるリズムパターンを成功裏に生成した。これは、トレーニングパターンとの平均距離指標によって確認された。
  • 生成されたパターンとトレーニングデータとの平均距離は、ベースラインのランダム生成よりも顕著に高かった。これは、モデルが単純な繰り返しや補間を避けることを示している。
  • ジャンルの曖昧さ損失は、ジャンル分類の信頼度を効果的に低下させ、第2の識別器が出力する確率がほぼ一様分布に近づいた。これにより、モデルが明確なジャンルラベルを割り当てないことが確認された。
  • 生成されたパターンの平均オンセット行列は、トレーニングデータとは構造的に異なる特徴を示し、特にリズム密度やオンセットクラスタリングの点で顕著な違いが見られた。これは、新しいリズム的構造が生成されたことを示唆している。
  • 予備的な結果では、マイクロティミング情報を組み込むことで、ジャンル分類器の性能が向上した。これは、マイクロティミングがスタイル的表現力を高めることを示唆している。
  • Ableton Live用の機能的なプラグインが正常に実装され、プロフェッショナルなDAW環境内でリアルタイムで新しいリズムパターンを生成可能となった。これにより、モデルの実用的応用性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。