Skip to main content
QUICK REVIEW

[논문 리뷰] HPPNet: Modeling the Harmonic Structure and Pitch Invariance in Piano Transcription

Weixing Wei, Peilin Li|arXiv (Cornell University)|2022. 08. 30.
Music and Audio Processing인용 수 4
한 줄 요약

HPPNet는 히어르키컬한 구조와 온도 불변성 사전 지식을 하모닉 드레인드 컨볼루션(HD-Conv)과 주파수 그룹화된 LSTM(FG-LSTM)을 통해 활용하여, MAESTRO에서 93.15% 프레임 F1, 97.18% 노트 F1의 최신 기술 수준(SOTA) 성능을 달성하면서도 오직 120만 개의 파rameter만을 사용하는 경량 피아노 변환 모델을 제안한다. 이는 이전의 SOTA 모델보다 크게 줄어든 수치이다.

ABSTRACT

While neural network models are making significant progress in piano transcription, they are becoming more resource-consuming due to requiring larger model size and more computing power. In this paper, we attempt to apply more prior about piano to reduce model size and improve the transcription performance. The sound of a piano note contains various overtones, and the pitch of a key does not change over time. To make full use of such latent information, we propose HPPNet that using the Harmonic Dilated Convolution to capture the harmonic structures and the Frequency Grouped Recurrent Neural Network to model the pitch-invariance over time. Experimental results on the MAESTRO dataset show that our piano transcription system achieves state-of-the-art performance both in frame and note scores (frame F1 93.15%, note F1 97.18%). Moreover, the model size is much smaller than the previous state-of-the-art deep learning models.

연구 동기 및 목표

  • 피아노 음향학에서 유도된 도메인 특화 사전 지식을 통합함으로써 피아노 변환의 모델 복잡도를 감소시키는 것.
  • 시간에 따라 히어르키컬한 구조와 온도 불변성 사전 지식을 모델링하여 성능과 효율성을 향상시키는 것.
  • 기존의 딥 러닝 접근 방식에 비해 파rameter 수를 크게 줄이면서도 높은 정확도를 유지하는 컴act한 모델을 개발하는 것.

제안 방법

  • 히어르키컬 분석에 적합한 로그 주파수 간격을 유지하기 위해 입력으로 Constant-Q Transform(CQT)을 사용한다.
  • 로그 주파수 스케일에서 히어르키컬 간격에 대응하는 확장률을 가진 하모닉 드레인드 컨볼루션(HD-Conv)을 적용하여 히어르키컬 시리즈를 캡처한다.
  • 각 주파수 대역을 별도로 처리함으로써 시간에 따른 온도 불변성 사전 지식을 모델링하는 주파수 그룹화된 LSTM(FG-LSTM)을 적용한다.
  • FG-LSTM의 주파수 그룹 간에 가중치를 공유함으로써 파rameter 수를 줄이면서도 시간 모델링 능력을 유지한다.
  • HD-Conv와 FG-LSTM을 종합적으로 통합하여 프레임 및 노트 예측을 동시에 수행하는 엔드 투 엔드 신경망 아키텍처를 구성한다.
  • 모든 기본 주파수에서 일관된 히어르키컬 간격을 확보하기 위해 Q=24 bins per octave로 CQT를 사용한다.

실험 결과

연구 질문

  • RQ1히어르키컬 간격을 갖는 확장 컨볼루션을 통해 히어르키컬 구조를 모델링하면 피아노 변환 성능이 향상되는가?
  • RQ2주파수 그룹화된 RNN를 통해 시간에 걸쳐 온도 불변성 사전 지식을 강제 적용하면 모델 정확도와 효율성이 향상되는가?
  • RQ3매우 적은 파rameter를 가진 모델이 기존의 큰 SOTA 모델을 능가할 수 있는가?
  • RQ4제안된 아키텍처는 작은 학습 데이터셋과 크로스 데이터셋 평가에 대해 어떻게 일반화되는가?
  • RQ5HD-Conv와 FG-LSTM이 모델 성능에 각각 기여하는 정도는 어느 정도인가?

주요 결과

  • HPPNet는 MAESTRO v3 검증 세트에서 93.15% 프레임 F1과 97.18% 노트 F1을 기록하여 새로운 SOTA 성능을 달성한다.
  • 모델은 오직 120만 개의 파rameter만을 사용하며, 트랜스포머 기반 SOTA 모델의 5,400만 개 파rameter보다 크게 줄어든다.
  • MAPS 데이터셋에서 HPPNet-sp는 87.56% 노트 F1을 기록하여 Onsets & Frames(83.04%)와 조정된 버전(86.44%)을 모두 능가한다.
  • 제거 실험 결과, FG-LSTM를 제거하거나 HD-Conv를 고정 확장 컨볼루션으로 대체할 경우, 프레임 F1은 약 3%p 감소하고, 노트 F1은 약 1%p 감소한다.
  • 소규모 학습 데이터셋에서도 뛰어난 성능을 유지하여, MAESTRO 학습 데이터의 10%만으로도 88.31% 프레임 F1과 93.52% 노트 F1을 달성한다.
  • 기존 기준 모델 대비 수렴 속도가 더 빠르고 안정적이며, 특히 RNN 레이어를 제거하거나 선형 레이어로 대체한 경우에 두드러진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.