Skip to main content
QUICK REVIEW

[論文レビュー] MidiNet: A Convolutional Generative Adversarial Network for Symbolic-domain Music Generation using 1D and 2D Conditions.

Li-Chia Yang, Szu-Yu Chou|arXiv (Cornell University)|Mar 31, 2017
Music Technology and Sound Studies参考文献 11被引用数 32
ひとこと要約

MidiNet は、1次元のコード条件(調性的文脈)と2次元の先行メロディ条件(順序的文脈)を用いて、16分音符解像度で1小節ずつ記号的音楽を生成する1次元および2次元の条件付き畳み込み GAN である。1小節あたり16×128の行列を出力することで、連結によって任意長で演奏可能な音楽シーケンスを生成できる。

ABSTRACT

In this paper, we present MidiNet, a deep convolutional neural network (CNN) based generative adversarial network (GAN) that is intended to provide a general, highly adaptive network structure for symbolic-domain music generation. The network takes random noise as input and generates a melody sequence one mea- sure (bar) after another. Moreover, it has a novel reflective CNN sub-model that allows us to guide the generation process by providing not only 1D but also 2D conditions. In our implementation, we used the intended chord of the current bar as a 1D condition to provide a harmonic context, and the melody generated for the preceding bar previously as a 2D condition to provide sequential information. The output of the network is a 16 by 128 matrix each time, representing the presence of each of the 128 MIDI notes in the generated melody sequence of that bar, with the smallest temporal unit being the sixteenth note. MidiNet can generate music of arbitrary number of bars, by concatenating these 16 by 128 matrices. The melody sequence can then be played back with a synthesizer. We provide example clips showing the effectiveness of MidiNet in generating harmonic music.

研究の動機と目的

  • 記号的音楽生成のための汎用的で適応性のあるディープラーニングフレームワークの開発。
  • 調性的(1次元)および順序的(2次元)文脈を用いた条件付き音楽生成の実現。
  • 構造的・調性的に一貫性のある、リアルタイムで小節ごとに生成される調和的メロディの生成。
  • 生成された小節を連結することで、任意長の音楽生成を可能にする。

提案手法

  • モデルは、1小節あたり16×128の行列(16分音符解像度)としてMIDIノートイベントを出力する条件付き GAN アーキテクチャを採用している。
  • 反射型 CNN サブモデルが、1次元のコード条件(調性的文脈)と2次元の先行メロディ条件(順序的文脈)を処理し、生成をガイドする。
  • 生成器はランダムノイズと条件ベクトルを入力とし、順次的に1小節ずつ生成する。
  • 識別器は生成された小節の真正性を評価し、実際のシーケンスと生成されたシーケンスを区別する。
  • ネットワークは、構造的一致性を保った音楽的に整合性のある調和的メロディを生成するように、エンドツーエンドで訓練される。
  • 生成された小節は連結され、任意長の音楽出力を可能にする。

実験結果

リサーチクエスチョン

  • RQ11次元および2次元の条件を備えた条件付き GAN は、小節ごとに音楽的に整合性があり調和的なメロディを生成できるか?
  • RQ21次元のコード条件と2次元の先行メロディ条件は、構造的一致性のある音楽生成をどの程度効果的にガイドできるか?
  • RQ3順次的に小節を生成して連結することで、長く連続するメロディを生成できるか?
  • RQ4反射型 CNN サブモデルは、無条件または単一条件ベースラインと比較して、生成品質をどの程度向上させるか?

主な発見

  • MidiNet は、現在のコード進行と事前に生成されたメロディを条件として用いることで、調和的で一貫性のある音楽シーケンスを効果的に生成した。
  • 2次元の先行メロディを条件として用いることで、小節間におけるメロディの連続性が維持された。
  • モデルは標準的な記号的フォーマット(16×128行列)で出力され、シンセサイザーで直接演奏可能である。
  • 小節ごとの生成プロセスにより、連結によって柔軟に任意長の音楽作成が可能になった。
  • 例の音声クリップは、モデルが音楽的に妥当で調和的であるメロディを生成できる能力を示している。
  • 反射型 CNN サブモデルは、1次元および2次元のマルチモーダル条件を効果的に統合し、生成品質の向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。