Skip to main content
QUICK REVIEW

[論文レビュー] Modelling Symbolic Music: Beyond the Piano Roll

Christian Walder|arXiv (Cornell University)|Jun 4, 2016
Music and Audio Processing参考文献 3被引用数 8
ひとこと要約

本論文では、和音的音楽を1変量のカテゴリカルな系列に変換することで、自然言語処理分野の最先端のLSTM言語モデルを活用する、記号的音楽生成の新規アプローチを提案する。全音階におけるトランスポジションを用いたデータ拡張と、任意のリズミカル構造のサポートにより、ベンチマークデータセットで最先端の性能を達成し、従来のRNNベースのモデルよりもより音楽的に洗練された出力を生成する。

ABSTRACT

In this paper, we consider the problem of probabilistically modelling symbolic music data. We introduce a representation which reduces polyphonic music to a univariate categorical sequence. In this way, we are able to apply state of the art natural language processing techniques, namely the long short-term memory sequence model. The representation we employ permits arbitrary rhythmic structure, which we assume to be given. We show that our model is effective on four out of four piano roll based benchmark datasets. We further improve our model by augmenting our training data set with transpositions of the original pieces through all musical keys, thereby convincingly advancing the state of the art on these benchmark problems. We also fit models to music which is unconstrained in its rhythmic structure, discuss the properties of this model, and provide musical samples which are more sophisticated than previously possible with this class of recurrent neural network sequence models. We also provide our newly preprocessed data set of non piano-roll music data.

研究の動機と目的

  • 同時進行のノートの複雑な組み合わせを伴う、連続的データ問題として和音的音楽をモデル化する課題に対処すること。
  • 固定時間のピアノロール表現の制限を克服し、音楽モデル化において任意のリズミカル構造を可能にすること。
  • 全音階にわたるトランスポジションによるデータ拡張を用いて、記号的音楽生成ベンチマークでの性能を向上させること。
  • 1変量の系列モデルとしてLSTMを用いることで、従来のRNNベースの手法を上回る音楽的に整合性があり洗練された作品を生成できることを示すこと。
  • 今後の研究を支援するため、非ピアノロール形式の記号的音楽の新しい前処理済みデータセットを公開すること。

提案手法

  • モデルは、和音的音楽を、各タイムステップが1つのカテゴリカルなノートまたはコードイベントを表す1変量のノートイベント系列に簡略化する。
  • 連続的な依存関係をモデル化するために、マルチレイヤーの長短期記憶(LSTM)ネットワークを用いる。
  • 入力表現は、88 MIDI ノートの語彙内の離散トークンとして各ノートを符号化し、クロスエントロピー損失を用いたエンドツーエンドの学習を可能にする。
  • データ拡張は、各オリジナル曲を全12の音階にトランスポジションすることで実施され、トレーニング分布が大幅に拡張され、一般化性能が向上する。
  • モデルは、入力として固定されたリズミカル構造に条件づけられるため、複雑で非一様なノートディレイレーションを持つ音楽を生成できる。
  • 学習された埋め込み層は、生のノートインデックスを密な意味的空間にマップし、オクターブ等価性のような構造的パターンを明らかにする。

実験結果

リサーチクエスチョン

  • RQ1LSTMを用いた1変量の系列モデリングアプローチは、同時に発音されるノートの複雑さを効果的に捉えることができるか?
  • RQ2全音階にわたるトランスポジションによるデータ拡張は、記号的音楽生成ベンチマークでの性能にどのように影響するか?
  • RQ3任意のリズミカル構造に条件づけられたRNNベースのモデルは、どの程度音楽的に整合性があり、リズム的に複雑な音楽を生成できるか?
  • RQ4学習された埋め込み空間は、オクターブ等価性やコード機能といった意味のある音楽的関係を捉えているか?
  • RQ5モデルはピアノロール形式のデータにとどまらず、より高品質な出力を生成する能力を一般化できるか?

主な発見

  • トランスポジションに基づくデータ拡張のおかげで、4つのピアノロールベースのベンチマークデータセットで最先端の性能を達成した。
  • モデルは、解像度の制限により従来のピアノロールベースのモデルでは実現不可能な、複雑で非一様なリズミカル構造を持つ音楽を生成できる。
  • 学習された埋め込み層は、生の入力が直交的かつ構造のないにもかかわらず、オクターブ等価性に対応する明確な構造的パターンを明らかにした。
  • モデルの性能は多様な音楽ソースに対して頑健であり、複数のソースからのデータを統合することでさらなる性能向上が得られた。
  • 著者らは、非ピアノロール形式の記号的音楽の新しい前処理済みデータセットを公開した。これは、アルゴリズム的作曲分野の今後の研究を支援する。
  • モデルが生成した音楽サンプルは、従来のRNNベースのモデルと比較して、より洗練されており、音楽的に整合性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。