Skip to main content
QUICK REVIEW

[論文レビュー] In Search of a Dataset for Handwritten Optical Music Recognition: Introducing MUSCIMA++

Jan Hajič, Pavel Pecina|arXiv (Cornell University)|Mar 14, 2017
Music and Audio Processing参考文献 26被引用数 5
ひとこと要約

この論文は、91,255個の手書き楽譜記号と82,261件の記号関係を手動でアノテートした大規模かつオープンソースのデータセットMUSCIMA++を紹介する。このデータセットにより、記号認識、局所化、楽譜グラフ構築のためのOMRシステムのトレーニングと評価が可能となる。データセットは、OMRのサブタスクを独立してまたは統合的にモデル化することを可能にし、オープンソースのツールと包括的なアノテーションフレームワークを併せて提供する。

ABSTRACT

Optical Music Recognition (OMR) has long been without an adequate dataset and ground truth for evaluating OMR systems, which has been a major problem for establishing a state of the art in the field. Furthermore, machine learning methods require training data. We analyze how the OMR processing pipeline can be expressed in terms of gradually more complex ground truth, and based on this analysis, we design the MUSCIMA++ dataset of handwritten music notation that addresses musical symbol recognition and notation reconstruction. The MUSCIMA++ dataset version 0.9 consists of 140 pages of handwritten music, with 91255 manually annotated notation symbols and 82261 explicitly marked relationships between symbol pairs. The dataset allows training and evaluating models for symbol classification, symbol localization, and notation graph assembly, both in isolation and jointly. Open-source tools are provided for manipulating the dataset, visualizing the data and further annotation, and the dataset itself is made available under an open license.

研究の動機と目的

  • 手書き光学楽譜認識(OMR)のための包括的かつ公開可能なデータセットの長年の不足を解消すること。
  • 複数の複雑さのレベルでOMRシステムのトレーニングと評価を可能にする基準データセットを確立すること。
  • 記号分類、局所化、楽譜グラフ構築の各タスクについて、独立および統合的なベンチマーク評価を可能にすること。
  • 高品質で細分化されたアノテーションを提供することで、OMRのための機械学習モデルの開発を支援すること。
  • 標準化された拡張可能なデータセットの提供により、将来的なアノテーションの自動化を促進すること。

提案手法

  • データセットはCVC-MUSCIMAコレクションから構築され、入力画像として手書き楽譜ページが使用された。
  • 91,255個の楽譜記号について、境界ボックスとクラスラベルを手動でアノテートした。
  • スタッフ線への接続、ノートヘッドからアコルドナル、トゥプラットからノートヘッドといった記号ペア間の明示的関係がアノテートされ、合計82,261件の関係が記録された。
  • 楽譜記号の階層的かつ関係的構造を表現するためのカスタムデータモデルが設計され、多段階の基準データをサポートした。
  • データ操作、可視化、将来のアノテーション拡張を目的としたオープンソースツールが開発された。
  • データセットはオープンライセンスでリリースされ、将来的なOMR研究パイプラインへの再利用と統合を可能にした。

実験結果

リサーチクエスチョン

  • RQ1手書きOMRのための包括的かつ細分化された基準データセットを、機械学習モデルのトレーニングと評価を可能にするために、どのように構築できるか?
  • RQ2OMRにおける記号分類、局所化、楽譜グラフ構築の正確なモデリングを可能にするために、どの程度のアノテーションの細分化が必要か?
  • RQ3明示的な記号関係を有するデータセットは、手書き楽譜からの音高と音符の長さの情報再構築を可能にするか?
  • RQ4OMRのサブタスクを独立しておよび統合的に評価できるように、データセットをどのように構造化できるか?
  • RQ5現在のアノテーションフォーマットの限界は何か。また、MEIのような標準フォーマットへの移行によって、それらの限界はどのように克服できるか?

主な発見

  • MUSCIMA++ v.0.9は、140ページ、91,255個のアノテート済み記号、82,261件の明示的記号関係を有する、手書きOMRのための最も包括的な公開基準データセットを提供する。
  • このデータセットにより、記号分類、局所化、楽譜グラフ構築の各モデルのトレーニングと評価が、個別的および統合的に可能となる。
  • 特にアコルドナルやトゥプラットとノートヘッドの関係を通じて、音高と音符の長さの再構築が部分的に推定可能である。
  • このデータセットは、音高と長さのシーケンスの再現性(replayability)およびタイプセット可能な楽譜表現への再出力性(reprintability)を求めるOMRシステムの開発を支援する。
  • このデータセットと関連ツールの可用性により、将来的なコンテストや標準化された評価の実施が可能になる。
  • 著者らは、将来的な改善としてMEIフォーマットへの移行、初期音楽資料の追加、および学習モデルによるアノテーションの自動化を特定している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。