Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting Noteheads in Handwritten Scores with ConvNets and Bounding Box Regression

Jan Hajič, Pavel Pecina|arXiv (Cornell University)|2017. 08. 05.
Music and Audio Processing참고 문헌 6인용 수 11
한 줄 요약

이 논문은 MUSCIMA++ 데이터셋의 이진 이미지에서 스태프 제거 없이도 0.97 F-스코어를 달성하는 가벼운 컨볼루션 신경망(ConvNet)을 제안한다. 이는 픽셀 단위 분류와 경계 박스 회귀를 사용하여 수작업으로 작성된 음악 스코어의 노트헤드를 검출하는 데 목적이 있다. 방법은 형태학적 스켈레톤 픽셀 기반의 동적 프로포절 메커니즘과 분류 및 위치 추정의 공동 학습을 활용하여 다양한 수기 스타일과 음악 복잡도에 대해 강력한 내성성을 보여준다.

ABSTRACT

Noteheads are the interface between the written score and music. Each notehead on the page signifies one note to be played, and detecting noteheads is thus an unavoidable step for Optical Music Recognition. Noteheads are clearly distinct objects, however, the variety of music notation handwriting makes noteheads harder to identify, and while handwritten music notation symbol {\em classification} is a well-studied task, symbol {\em detection} has usually been limited to heuristics and rule-based systems instead of machine learning methods better suited to deal with the uncertainties in handwriting. We present ongoing work on a simple notehead detector using convolutional neural networks for pixel classification and bounding box regression that achieves a detection f-score of 0.97 on binary score images in the MUSCIMA++ dataset, does not require staff removal, and is applicable to a variety of handwriting styles and levels of musical complexity.

연구 동기 및 목표

  • 수기 음악 스코어에서 노트헤드를 신뢰성 있게 검출하는 데 있어, 기존 규칙 기반 방법이 수기의 변동성으로 인해 실패하는 문제를 해결하기 위해.
  • 다양한 수기 스타일과 음악 복잡도 수준에 일반화되는 기계 학습 기반 검출기를 개발하기 위해.
  • 스태프 제거가 필요 없도록 하여 OMR 파이프라인을 단순화하고 종단 간 성능을 향상시키기 위해.
  • 단순하고 경량의 ConvNet이 분류 및 회귀를 공동으로 수행할 경우 수작업 OMR에서 히우리스틱 방법을 능가할 수 있음을 입증하기 위해.
  • 오프라인 수작업 음악 광학 인식에서 확장 가능하고 학습 가능한 기호 검출의 기반을 마련하기 위해.

제안 방법

  • 검출 네트워크의 입력 위치로 이진 스코어 이미지에서 스켈레톤 픽셀을 선택하는 타겟 픽셀 생성기가 사용된다.
  • 각 타겟 픽셀에 대해 네트워크는 이진 클래스(노트헤드 또는 아님)와 노트헤드 가장자리에 대한 상대 위치를 인코딩하는 경계 박스 회귀 벡터를 예측한다.
  • 검출 네트워크는 타겟 픽셀 중심의 패치를 입력으로 사용하는 소형 맞춤형 ConvNet이며, 효율성을 위해 입력 크기는 51×51이다.
  • 프로포절 필터는 근접한 다수의 타겟 픽셀 예측을 병합하여 검출 출력을 정밀하게 조정하고 가짜 양성 결과를 줄이기 위해 별도의 분류기를 사용한다.
  • 고정된 프로포절 격자 대신 이미지 구조에 기반해 동적으로 영역을 생성함으로써 기존 RCNN과는 다름을 보인다.
  • MUSCIMA++ 데이터셋의 참값 레이블을 사용한 지도 학습으로 네트워크를 훈련시키며, 노트헤드 영역의 양성 및 음성 픽셀만을 사용한다.

실험 결과

연구 질문

  • RQ1스태프 제거 없이도 분류 및 경계 박스 회귀를 공동으로 수행하는 경량 ConvNet이 수작업 스코어에서 노트헤드 검출에 높은 정확도를 달성할 수 있는가?
  • RQ2검출기의 성능은 다양한 수기 스타일과 음악 복잡도 수준에서 어떻게 변할까?
  • RQ3형태학적 스켈레톤 픽셀을 타겟 위치로 사용할 경우 검출 효율성과 정확도는 얼마나 향상되는가?
  • RQ4고정 격자 기반 RCNN 방법과 비교해 동적 프로포절 메커니즘은 내성성과 추론 속도 측면에서 어떻게 다른가?
  • RQ5저품질 또는 손상된 스코어 이미지에 대해 검출기가 일반화 가능한가? 주요 실패 원인은 무엇인가?

주요 결과

  • MUSCIMA++ 데이터셋의 이진 스코어 이미지를 사용하여 검출기는 다양한 수기 스타일에서 높은 정밀도와 재현율을 보이며 F-스코어 0.97를 달성한다.
  • 스태프 제거가 필요 없어져 OMR 파이프라인이 단순화되고 스태프 선 제거로 인한 오류 전파가 감소한다.
  • 스켈레톤 픽셀을 타겟 위치로 사용함으로써 전경 픽셀의 약 10%로 입력 후보 수를 줄였지만, 정확한 노트헤드 분류의 97% 이상를 유지한다.
  • 복잡한 스코어와 다양한 수기 스타일에 대해 잘 일반화되어 있으며, 겹치는 기호나 비표준 표기법에 대해서도 내성성을 보인다.
  • 저품질, 흐린, 또는 잘 이진화되지 않은 이미지에서는 필터링 없이 F-스코어 0.85, 필터링 유무에 따라 0.79로 떨어지며, 입력 품질에 민감함을 보인다.
  • 후처리 필터링 분류기는 취약한 구성 요소로 특정 것으로 밝혀졌으며, 고급 네트워크 출력에 크게 의존하고, 공동 학습이 불가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.