[논문 리뷰] Towards Score Following In Sheet Music Images.
이 논문은 음원 스니펫을 직접 시트 음악 이미지의 픽셀 위치에 매칭하는 엔드 투 엔드 딥 러닝 모델을 제안한다. 이는 상징적 스코어 표현 방식을 생략하는 방식이다. 짝지어진 시트 이미지와 스펙트로그램으로 훈련된 다중 모달 컨볼루션 신경망을 사용하여, 단일 피아노 음악에서 음표를 한 버킷 너비 이내로 국소화하는 데 71.72%의 정확도를 달성하였으며, 이는 단일 피아노 음악에서 직접 음원-시트 이미지 정렬의 가능성을 입증한다.
This paper addresses the matching of short music audio snippets to the corresponding pixel location in images of sheet music. A system is presented that simultaneously learns to read notes, listens to music and matches the currently played music to its corresponding notes in the sheet. It consists of an end-to-end multi-modal convolutional neural network that takes as input images of sheet music and spectrograms of the respective audio snippets. It learns to predict, for a given unseen audio snippet (covering approximately one bar of music), the corresponding position in the respective score line. Our results suggest that with the use of (deep) neural networks -- which have proven to be powerful image processing models -- working with sheet music becomes feasible and a promising future research direction.
연구 동기 및 목표
- 음원-스코어 정렬에서 상징적 스코어 표현 방식(예: MusicXML, MIDI)의 필요성을 제거하기 위해, 시트 음악 이미지와 음원 스펙트로그램에서 직접 학습하도록 설계한다.
- 노트를 읽고 음악을 듣는 동시에, 시트 음악 이미지 내 해당하는 픽셀 위치를 예측할 수 있는 시스템을 개발한다.
- 원시 이미지 및 음원 입력으로 다중 모달 신경망을 훈련시켜 수작업 특징 공학 없이 엔드 투 엔드 학습을 가능하게 한다.
- 저자원, 단일 스태프, 단성음 피아노 환경에서 직접 음원-시트 이미지 매칭을 위한 개념 증명을 수립한다.
제안 방법
- 모델은 시트 음악 이미지(40×390 픽셀)와 1.2초 분량의 음원 스니펫 스펙트로그램(40×136 프레임)을 입력으로 사용하는 다중 모달 컨볼루션 신경망을 사용한다.
- 네트워크는 버킷 분류를 수행하여 스태프의 x축을 이산적인 간격(버킷)으로 나누고, 각 음원 스니펫에 대해 이러한 버킷 위의 확률 분포를 예측한다.
- 모델은 정답 픽셀 좌표에서 유도된 소프트 타겟 벡터를 사용하여 훈련되며, 이는 인접한 버킷 간의 부드러운 보간을 가능하게 한다.
- 주의 시각화를 위해 시각화 지도를 계산하였으며, 이는 네트워크가 정확한 국소화를 위해 음표 머리와 줄기 특징에 집중하고 있음을 보여준다.
- 정렬을 위해 1.2초의 고정된 시간적 맥락을 사용하여, 타겟 음표 발음 이전의 충분한 음원 맥락을 제공한다.
- 추론 시, 모델은 상징적 스코어 파싱 없이 주어진 음원 스니펫과 시트 음악 이미지에서 예측된 픽셀 위치 $\hat{x}_j$를 산출한다.
실험 결과
연구 질문
- RQ1딥 뉴럴 네트워크는 상징적 스코어 표현 없이도 음원 스니펫을 시트 음악 이미지의 픽셀 위치에 직접 매칭할 수 있는가?
- RQ2이미지와 스펙트로그램 입력으로 훈련된 다중 모달 네트워크는 단일 스태프 선상의 정확한 음표 위치를 얼마나 잘 예측할 수 있는가?
- RQ3소프트 타겟과 버킷 분류의 사용이 직접 회귀에 비해 국소화 정확도를 향상시키는가?
- RQ4모델은 훈련 중에 볼 수 없었던 실생활 연주, 예를 들어 피아노 곡의 라이브 녹음에 일반화할 수 있는가?
주요 결과
- 실제 바흐의 G장조의 민우에트 녹음에서 모델은 정규화된 픽셀 거리 0.0402를 기록하여 높은 국소화 정확도를 입증하였다.
- 예측된 음표 위치 중 71.72%가 정답의 한 버킷 너비 이내에 위치하여, 예측되지 않은 음원에서의 견고한 성능을 보였다.
- 시각화 지도를 통해 네트워크가 음표 머리와 줄기 스타일과 같은 관련 시각적 특징에 집중하고 있음을 확인하였으며, 효과적인 특징 학습이 이루어졌음을 시사한다.
- 소프트 타겟의 사용은 버킷 간의 부드러운 보간을 가능하게 하여, 하드 회귀에 비해 국소화 정밀도를 향상시켰다.
- 1.2초의 웜업 기간 이후, 연속된 음원 스트림에서 온라인 스코어 팔로잉을 성공적으로 수행하여 실시간 응용 가능성을 검증하였다.
- 이 접근법은 단성음, 단일 스태프 피아노 음악에 대해 가능하며, 향후 다중 스태프 스코어를 처리하는 시스템의 기초로 유망한 전망을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.