[논문 리뷰] High-resolution Piano Transcription with Pedals by Regressing Onset and Offset Times
이 논문은 깊이 학습 모델을 사용하여 정확한 온셋 및 오프셋 시간을 회귀함으로써 임의의 시간 해상도를 갖는 고해상도 피아노 변환 시스템을 제안한다. 추론 시 분석 알고리즘을 통해 정확한 타이밍을 계산하여, MAESTRO에서 온셋 F1 점수 96.72%를 달성하고, 처음으로 보고된 보조 페달 변환 F1 점수 91.86%를 확보한다.
Automatic music transcription (AMT) is the task of transcribing audio recordings into symbolic representations. Recently, neural network-based methods have been applied to AMT, and have achieved state-of-the-art results. However, many previous systems only detect the onset and offset of notes frame-wise, so the transcription resolution is limited to the frame hop size. There is a lack of research on using different strategies to encode onset and offset targets for training. In addition, previous AMT systems are sensitive to the misaligned onset and offset labels of audio recordings. Furthermore, there are limited researches on sustain pedal transcription on large-scale datasets. In this article, we propose a high-resolution AMT system trained by regressing precise onset and offset times of piano notes. At inference, we propose an algorithm to analytically calculate the precise onset and offset times of piano notes and pedal events. We show that our AMT system is robust to the misaligned onset and offset labels compared to previous systems. Our proposed system achieves an onset F1 of 96.72% on the MAESTRO dataset, outperforming previous onsets and frames system of 94.80%. Our system achieves a pedal onset F1 score of 91.86\%, which is the first benchmark result on the MAESTRO dataset. We have released the source code and checkpoints of our work at https://github.com/bytedance/piano_transcription.
연구 동기 및 목표
- 프레임 단위 온셋/오프셋 검출 방법에서 제한된 시간 해상도 문제를 해결하되, 이는 프레임 간격(예: 32 ms)에 의해 제한된다.
- 기존 시스템의 성능을 떨어뜨리는 학습 데이터 내 온셋 및 오프셋 레이블의 정렬 오차에 대한 강건성을 향상시킨다.
- 이진 프레임 수준 예측이 아닌 정확한 온셋 및 오프셋 시간을 모델링하여 고해상도 변환을 가능하게 한다.
- MAESTRO 데이터셋에서 보조 페달 변환에 대한 첫 번째 종합적 평가를 제공하고, 기준점을 설정한다.
- 임의의 해상도를 갖는 정확한 온셋 및 오프셋 시간을 계산하기 위해 분석적 추론 알고리즘을 개발한다.
제안 방법
- 각 오디오 프레임의 중심과 가장 가까운 온셋 또는 오프셋 시간 사이의 시간 차이를 회귀하기 위해 깊이 신경망을 훈련한다.
- 이진 레이블 대신 회귀 타겟을 사용하여, 노트와 보조 페달 모두에 대해 세밀한 타이밍 정보를 유지한다.
- 추론 시 시간 차이에 대한 미분 가능한 손실 함수를 최소화하여 정확한 온셋 및 오프셋 시간을 분석적으로 계산한다.
- MAEST로 훈련된 CNN 기반 아키텍처에 잔차 연결을 적용하여, 노트 및 페달 변환 모두에 대해 엔드 투 엔드로 훈련한다.
- 해상도와 강건성 평가를 위해 변동 가능한 허용 오차 수준(온셋: 2–100 ms, 오프셋: 10–500 ms)을 사용한 새로운 평가 프로토콜을 도입한다.
- 프레임 단위의 회귀를 사용하여 페달 온셋 및 오프셋 이벤트를 탐지하기 위해 별도의 헤드를 구현한다.
실험 결과
연구 질문
- RQ1온셋 및 오프셋 시간의 회귀 기반 모델링이 이진 프레임 수준 분류보다 더 높은 변환 해상도를 달성할 수 있는가?
- RQ2고정 허용 오차 기반 베이스라인과 비교해 복수의 온셋 및 오프셋 평가 허용 오차 수준에서 제안된 시스템의 성능은 어떠한가?
- RQ3학습 데이터 내 정렬 오차가 있는 진짜 레이블에 대해 모델의 강건성은 어느 정도인가?
- RQ4회귀 기반 접근 방식이 노트 및 보조 페달 변환 모두에서 최고 성능을 달성할 수 있는가?
- RQ5회귀 출력에서 분석적으로 정확한 온셋 및 오프셋 시간을 계산하는 것이 가능하며, 이는 임의의 시간 해상도를 가능하게 하는가?
주요 결과
- 제안된 시스템은 MAESTRO 데이터셋에서 온셋 F1 점수 96.72%를 달성하여, 모든 테스트 허용 오차 수준에서 이전의 onsets and frames 시스템(94.80%)을 초월한다.
- 100 ms 허용 오차에서 시스템은 노트 F1 점수 96.79%를 기록하여 고해상도 평가에서 뛰어난 성능을 보였다.
- 50 ms 허용 오차에서 시스템은 페달 온셋 F1 점수 91.86%를 기록하여, MAESTRO 데이터셋에서 보조 페달 변환에 대한 첫 번째 기준점 결과를 확보했다.
- 유사한 평가 프로토콜 하에서 재현된 onsets and frames 베이스라인과 비교해 시스템은 페달 변환에서 91.86% 대비 91.57%의 F1 점수로 우월한 성능을 보였다.
- 오류 분석 결과, 가짜 양성은 주로 옥타브 오류와 짧은 지속 시간 노트(<15 ms)에서 기인하며, 가짜 음성은 주로 고음 또는 저음 옥타브에 영향을 받는다.
- 조율이 어긋난 피아노 또는 저품질 녹음에서 성능 저하가 발생함에 따라, 시스템은 음질과 조율 정확도에 민감함을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.