Skip to main content
QUICK REVIEW

[論文レビュー] Symbolic Music Data Version 1.0

Christian Walder|arXiv (Cornell University)|Jun 8, 2016
Music and Audio Processing参考文献 4被引用数 3
ひとこと要約

本稿では、クラシカル・アーカイブスから収集した19,700件のクリーニング済み・前処理済みMIDIファイルから構成される、Symbolic Music Data V1.0という新しいデータセットを紹介する。このデータセットは、tick単位のノートの開始・終了時刻によってシンボリック音楽を表現している。著者らは、低品質なファイルを除外するために確率的フィルタリングモデルを適用し、署名ベクトルを用いた階層的クラスタリングにより、トレイン/バリエーション/テスト分割を実施した。また、従来のピアノロール形式よりも、ノートの持続時間やポリフォニーの表現をより正確に捉えた洗練された表現形式を提供している。

ABSTRACT

In this document, we introduce a new dataset designed for training machine learning models of symbolic music data. Five datasets are provided, one of which is from a newly collected corpus of 20K midi files. We describe our preprocessing and cleaning pipeline, which includes the exclusion of a number of files based on scores from a previously developed probabilistic machine learning model. We also define training, testing and validation splits for the new dataset, based on a clustering scheme which we also describe. Some simple histograms are included.

研究の動機と目的

  • 機械学習モデルのトレーニングを目的とした、高品質で大規模なシンボリック音楽データセットの構築。
  • ピアノロール表現の限界を克服するため、二値のオン/オフ状態ではなく、明示的なノートのオンセットとオフセットをモデル化すること。
  • 同一の音楽的曲が複数のバージョンを含む場合に生じるデータ漏洩や統計的依存性を低減するため、音楽的コンテンツに基づいてファイルをクラスタリングしてデータ分割を設計すること。
  • 学習済み確率的モデルを用いて、低品質または破損したMIDIファイルを除外することで、データ品質を向上させること。
  • 正確な時間的ノート境界を保持することで、ポリフォーニック音楽や表現的テンポのモデリングをより正確に実現すること。

提案手法

  • 古典アーカイブスから収集した20,006件のMIDIファイルをもとに、ヒューリスティックなフィルタリングスコアにより306件を除外した。
  • フィルタリングスコアは、事前に訓練されたモデルにおける負の対数尤度の平均に加え、標準誤差を加算することで算出され、低品質なファイルを特定する。
  • スustainペダル効果の処理と、同じチャンネル上での重複または重なり合うノートの除去を含め、ノートイベントを処理した。
  • パーカッショントラックおよび2ノート未満のチャンネルは、ピッチド楽器のモデリングと整合性を保つために除外した。
  • 時間的表現を標準化するため、全ソースデータセットと同一の解像度である1四分音符あたり2400tickに再サンプリングした。
  • 各ファイルの署名ベクトルは、正規化されたピッチクラスと量子化されたノート持続時間のヒストグラムから作成され、階層的クラスタリングに用いられ、データ分割の構築に使用された。

実験結果

リサーチクエスチョン

  • RQ1ピアノロール表現と比較して、時間的忠実性を向上させた大規模なシンボリック音楽データセットをどのように構築できるか?
  • RQ2元のファイルにアクセスできない状況下で、大規模なアーカイブから低品質または破損したMIDIファイルを効果的にフィルタリングする方法は何か?
  • RQ3同一の音楽的曲の複数のバージョンが存在する場合、統計的依存性を最小限に抑えるために、データ分割をどのように設計すべきか?
  • RQ4既存のフォーマットと比較して、新しい表現形式が、表現的テンポやポリフォニー構造をどの程度正確に保持しているか?
  • RQ5既存のデータセットで訓練された確率的モデルは、新しい大規模コロナから低品質なファイルを効果的に特定・除外できるか?

主な発見

  • 著者らは、20,006件の元データから、学習済みフィルタリングスコアに基づき306件を除外し、19,700件の高品質MIDIファイルから成るデータセットをキュレートした。
  • 負の対数尤度と標準誤差に基づくフィルタリング手法は、聴取テストを通じて妥当性が検証され、低品質なファイルの特定に効果的に機能した。
  • 階層的クラスタリングに基づく分割戦略により、連続的で内容が類似した塊としてのトレイン・バリエーション・テストセットが得られ、データ漏洩が低減された。
  • CMAデータセットには、46パートに達する曲が含まれており、ラヴェルの「ヴァルセ・ノーブル・エ・センティメンタールズ」やホルストの「ヴェナス」のような複雑なポリフォニー音楽を反映している。
  • 新しい表現形式は、ピアノロール形式よりもノート持続時間やポリフォニー性をより正確に捉えており、表現的演奏のモデリングを向上させることができる。
  • データセットは、1四分音符あたり2400tickという標準化された解像度でリリースされており、モデル間の互換性を確保するとともに、量子化誤差を低減している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。