[논문 리뷰] An Empirical Evaluation of End-to-End Polyphonic Optical Music Recognition
이 논문은 공통된 CNN-BiLSTM 인코더를 활용하여 다성분 옵티컬 마우스 음악 인식(OMR)을 위한 두 가지 새로운 엔드 투 엔드 신경망 디코딩 아키텍처—FlagDecoder와 RNNDecoder—를 제안한다. RNNDecoder는 MuseScore에서 유래한 대규모 다성분 데이터셋에서 기존 최고 성능을 넘어선 기록을 달성하며, 표준 및 어려운 테스트 세트에서 모두 뛰어난 성능을 보였다.
Previous work has shown that neural architectures are able to perform optical music recognition (OMR) on monophonic and homophonic music with high accuracy. However, piano and orchestral scores frequently exhibit polyphonic passages, which add a second dimension to the task. Monophonic and homophonic music can be described as homorhythmic, or having a single musical rhythm. Polyphonic music, on the other hand, can be seen as having multiple rhythmic sequences, or voices, concurrently. We first introduce a workflow for creating large-scale polyphonic datasets suitable for end-to-end recognition from sheet music publicly available on the MuseScore forum. We then propose two novel formulations for end-to-end polyphonic OMR -- one treating the problem as a type of multi-task binary classification, and the other treating it as multi-sequence detection. Building upon the encoder-decoder architecture and an image encoder proposed in past work on end-to-end OMR, we propose two novel decoder models -- FlagDecoder and RNNDecoder -- that correspond to the two formulations. Finally, we compare the empirical performance of these end-to-end approaches to polyphonic OMR and observe a new state-of-the-art performance with our multi-sequence detection decoder, RNNDecoder.
연구 동기 및 목표
- 엔드 투 엔드 훈련에 적합한 대규모, 공개 가능한 다성분 OMR 데이터셋의 부족 문제를 해결하기 위해.
- 다성분 음악 표기에서 여러 음성들을 효과적으로 모델링할 수 있는 새로운 신경망 디코딩 아키텍처를 개발하기 위해.
- 새로운 데이터셋에서 이러한 아키텍처를 실험적으로 평가하고, 엔드 투 엔드 다성분 OMR의 새로운 최고 성능 기준을 수립하기 위해.
- 밀도 높은 코드와 다수의 음성들을 포함한 어려운 다성분 구간에서의 일반화 및 강인성 향상을 위해.
제안 방법
- 공개된 MuseScore 포럼의 파일들로부터 다성분 악보를 추출하고 주석을 붙이는 데 중점을 둔 데이터 수집 워크플로우를 설계하여, MuseScore 다성분 데이터셋(MSPD)과 그의 어려운 서브셋(MSPD-Hard)을 확보하였다.
- 모든 모델에서 일관된 표현을 확보하기 위해, 스태프선 이미지에서 특징을 추출하기 위해 공통된 인코더—CNN 이후 이중방향 LSTM으로 구성된 인코더—를 사용하였다.
- FlagDecoder는 다성분 OMR를 다중 작업 이진 분류 문제로 간주하며, 플래그 기반의 기호 표현을 사용하여 동시에 음고, 스태프 기호, 리듬을 예측한다.
- RNNDecoder는 수직 방향으로 이미지 슬라이스를 열거하는 방식의 수직 RNN 디코더를 사용하여, 한 가로 위치에서 여러 기호를 동시에 예측할 수 있도록 하여 다성분을 효과적으로 모델링한다.
- 두 디코더 모두 교차 엔트로피 손실을 사용하여 훈련되며, RNNDecoder는 변수적인 다성분성을 처리하기 위해 각 이미지 슬라이스에 대해 고정 길이의 출력 시퀀스를 사용한다.
- 모델 평가에는 표기 오류율(SER)이 사용되었으며, 음고 및 리듬에 대해 별도의 지표를 설정하여 전체 및 어려운 테스트 세트에서 평가하였다.
실험 결과
연구 질문
- RQ1MuseScore와 같은 공개된 악보 자료에서 다성분 옵티컬 마우스 음악 인식(OMR)을 위한 대규모, 엔드 투 엔드 훈련 가능한 데이터셋을 효과적으로 구축할 수 있는가?
- RQ2FlagDecoder와 RNNDecoder와 같은 새로운 디코딩 전략은 기존 엔드 투 엔드 OMR 모델에 비해 다성분 음악을 다룰 때 어떻게 비교되는가?
- RQ3RNNDecoder의 수직 시퀀스 모델링 접근 방식은 기준 모델 및 다중 작업 접근 방식에 비해 밀도 높은 다음 음성 음악 구간에서 성능 향상에 기여하는가?
- RQ4제안된 모델이 훈련 중에 볼 수 없었던 도전적인 고다성분 예제에 얼마나 잘 일반화되는가?
주요 결과
- RNNDecoder는 전체 테스트 세트에서 새로운 최고 성능 기록을 달성하며, 기준 모델과 FlagDecoder 모두를 앞서나갔다.
- 어려운 테스트 세트(MSPD-Hard)에서는 RNNDecoder가 기준 모델보다 훨씬 더 뛰어난 강인성을 보였으며, 오류율 증가 폭이 훨씬 작았고, 기준 모델은 오류율이 거의 두 배로 증가했다.
- 모든 모델에서 음고 SER는 리듬 SER보다 항상 높았으며, 이는 특히 명료도 및 스태프 위치의 모호성으로 인해 음고 인식이 더 어려운 것으로 보인다.
- 정성 분석 결과, RNNDecoder는 네 음성이 동시에 존재하는 밀도 높은 코드를 올바르게 처리했으며, 복잡한 코드 진행에서 단 한 개의 음과 조작 기호를 빼고는 모두 정확히 인식하였다.
- FlagDecoder는 전체 테스트 세트에서는 기준 모델을 능가했지만, 특히 고다성분 상황에서의 음고 인식에서 어려운 세트에서의 성능 향상이 제한적이었다.
- RNNDecoder는 네 개의 동시에 존재하는 음성으로 구성된 고다성분 예제에서 뛰어난 성능을 보였으며, 기준 모델은 음을 분리하거나 정확히 식별하지 못했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.