Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Noteheads in Handwritten Scores with ConvNets and Bounding Box Regression

Jan Hajič, Pavel Pecina|arXiv (Cornell University)|Aug 5, 2017
Music and Audio Processing参考文献 6被引用数 11
ひとこと要約

この論文は、MUSCIMA++ データセットのバイナリ画像を用いて、スタッフ線の除去を要せず、ピクセル単位の分類とバウンディングボックス回帰を用いた軽量な畳み込みニューラルネットワーク(ConvNet)を提示する。ノートヘッド検出において 0.97 の F スコアを達成し、多様な筆圧の変動や音楽の複雑さに強く、優れた耐性を示す。本手法は、形状的スケルトンピクセルに基づく動的プロポーザル機構と、分類と局所化の共同学習を活用している。

ABSTRACT

Noteheads are the interface between the written score and music. Each notehead on the page signifies one note to be played, and detecting noteheads is thus an unavoidable step for Optical Music Recognition. Noteheads are clearly distinct objects, however, the variety of music notation handwriting makes noteheads harder to identify, and while handwritten music notation symbol {\em classification} is a well-studied task, symbol {\em detection} has usually been limited to heuristics and rule-based systems instead of machine learning methods better suited to deal with the uncertainties in handwriting. We present ongoing work on a simple notehead detector using convolutional neural networks for pixel classification and bounding box regression that achieves a detection f-score of 0.97 on binary score images in the MUSCIMA++ dataset, does not require staff removal, and is applicable to a variety of handwriting styles and levels of musical complexity.

研究の動機と目的

  • 手書き楽譜におけるノートヘッド検出の課題に取り組む。従来のルールベース手法は筆圧のばらつきにより失敗するため。
  • 多様な筆圧のスタイルや音楽の複雑さに一般化できる機械学習ベースの検出器を開発する。
  • スタッフ線の除去を不要とすることで、OMR パイプラインを簡素化し、エンドツーエンドの性能を向上させる。
  • 分類と回帰の共同学習を施した単純で軽量な ConvNet が、ヒューリスティック手法を上回ることを示す。
  • オフライン手書き楽譜認識におけるスケーラブルでトレーニング可能な記号検出の基盤を提供する。

提案手法

  • 検出ネットワークの入力位置として、バイナリ楽譜画像からスケルトンピクセルを選択するターゲットピクセル生成器を用いる。
  • 各ターゲットピクセルに対して、ネットワークは二値分類(ノートヘッドか否か)と、ノートヘッドの端縁からの相対位置を符号化するバウンディングボックス回帰ベクトルを予測する。
  • 検出ネットワークは、ターゲットピクセルを中心としたパッチを入力とし、効率性を考慮して入力サイズ 51×51 の小規模でカスタムされた ConvNet であり、エンドツーエンドで学習される。
  • プロポーザルフィルタは、複数の近接ターゲットピクセルからの予測を統合し、別個の分類器を用いて検出出力を精緻化し、誤検出を低減する。
  • 固定グリッドのプロポーザルを避けるために、画像構造に基づいて動的に領域を生成する点で、標準的な RCNN とは異なる。
  • MUSCIMA++ データセットの正例・負例ピクセル(ノートヘッド領域からのみ)を用いて、教師あり学習によりネットワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1分類とバウンディングボックス回帰の共同学習を施した軽量 ConvNet は、スタッフ線の除去を要せず、手書き楽譜におけるノートヘッド検出で高い精度を達成できるか?
  • RQ2検出器の性能は、多様な筆圧のスタイルや音楽の複雑さの変動に対してどのように変化するか?
  • RQ3形状的スケルトンピクセルをターゲット位置として使用することで、検出の効率性と正確性がどの程度向上するか?
  • RQ4固定グリッド RCNN アプローチと比較して、動的プロポーザル機構は、耐性と推論速度の面で優れているか?
  • RQ5検出器は、低品質または劣化した楽譜画像にも一般化可能か?主な失敗要因は何か?

主な発見

  • MUSCIMA++ データセットを用いたバイナリ楽譜画像において、F スコア 0.97 を達成し、多様な手書きスタイルにわたって高い正確性と再現率を示した。
  • スタッフ線の除去を不要としており、OMR パイプラインを簡素化し、スタッフ線除去に起因する誤差伝搬を低減した。
  • スケルトンピクセルをターゲット位置として使用することで、フォアグラウンドピクセルの約 10% にまで入力候補を削減しながら、正しく分類されるノートヘッドの 97% 以上を保持した。
  • 複雑な楽譜や多様な筆圧のスタイルに対しても良好に一般化し、重なりのある記号や非標準的な記法に対しても耐性を示した。
  • 低品質、ぼやけた、または不適切に二値化された画像では、フィルタリングなしで F スコアが 0.85 に低下し、フィルタリングありでは 0.79 にまで低下した。入力品質への感受性が示された。
  • 後処理フィルタ分類器は脆弱なコンponentと特定され、高品質なネットワーク出力に強く依存しており、共同学習ができないことが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。