Skip to main content
QUICK REVIEW

[논문 리뷰] A Holistic Approach to Polyphonic Music Transcription with Neural Networks

Miguel A. Román, Antonio Pertusa|arXiv (Cornell University)|2019. 10. 26.
Music and Audio Processing참고 문헌 17인용 수 15
한 줄 요약

이 논문은 중간 피아노롤 표현을 생략하고 CTC 손실을 사용하는 CRNN를 활용한 종단간 전력 신경망 프레임워크를 제안한다. 이는 직접 음성에서 기호 음악 점자로의 변환을 가능하게 한다. 합성된 스트링 쿠арт렛과 바흐의 차오랄을 훈련 데이터로 사용했으며, 쿠арт렛에서 WER 21.02%와 CER 13.53%를 달성하여, 단계별 정렬이나 오류 전파 없이 직접 표기 수준의 변환 가능성을 입증한다.

ABSTRACT

We present a framework based on neural networks to extract music scores directly from polyphonic audio in an end-to-end fashion. Most previous Automatic Music Transcription (AMT) methods seek a piano-roll representation of the pitches, that can be further transformed into a score by incorporating tempo estimation, beat tracking, key estimation or rhythm quantization. Unlike these methods, our approach generates music notation directly from the input audio in a single stage. For this, we use a Convolutional Recurrent Neural Network (CRNN) with Connectionist Temporal Classification (CTC) loss function which does not require annotated alignments of audio frames with the score rhythmic information. We trained our model using as input Haydn, Mozart, and Beethoven string quartets and Bach chorales synthesized with different tempos and expressive performances. The output is a textual representation of four-voice music scores based on **kern format. Although the proposed approach is evaluated in a simplified scenario, results show that this model can learn to transcribe scores directly from audio signals, opening a promising avenue towards complete AMT.

연구 동기 및 목표

  • 다양한 음악적 요소를 포함한 폴리포닉 음성에서 직접 기호 음악 점자를 생성하는 통합적 종단간 자동 음악 변환(AMT) 방법 개발
  • 기존 AMT 파이프라인에서 흔히 볼 수 있는 다단계 처리(예: 음고 검출, 노트 추적, 정량화)를 피함으로써 오류 전파를 제거
  • 신경망이 단일 프레임 수준의 정렬 없이도 유효한 **kern 포맷 음악 점자를 직접 음성에서 학습하여 생성할 수 있음을 입증
  • 실제 음성과 더 복잡한 음악적 구조를 다룰 수 있는 표기 수준의 AMT 연구를 위한 기반 마련

제안 방법

  • 원시 음성 스펙트로그램을 처리하고 기호 음악 토큰의 시퀀스를 생성하기 위해 컨volutional Recurrent Neural Network(CRNN)를 사용
  • 정확한 프레임-기호 정렬이 필요로 하지 않는 Connectionist Temporal Classification(CTC) 손실을 사용해 훈련
  • 입력 음성은 하이든, 모차르트, 베토벤의 스트링 쿠арт렛과 바흐의 차오랄을 다양한 템포와 표현적 다이내믹스로 합성한 성악 성능
  • 출력은 **kern 형식의 텍스트 표현으로, MusicXML이나 악보로 변환 가능
  • 훈련은 100 에포크 동안 미니배치 SGD를 사용하고, Nesterov 모멘텀과 코즈인 애너일링 학습률 스케줄링 적용
  • 검증 WER가 가장 낮은 모델을 최종 모델로 선택하고, 평가에는 Word Error Rate(WER)와 Character Error Rate(CER) 사용

실험 결과

연구 질문

  • RQ1중간 피아노롤 표현 없이도 단일 단계 신경망이 폴리포닉 음성에서 유효한 기호 음악 점자를 직접 생성할 수 있는가?
  • RQ2CTC 손실을 갖는 CRNN가 정확한 음고, 지속시간, 음성 분리 기능을 갖춘 복잡한 폴리포닉 음악을 얼마나 잘 변환할 수 있는가?
  • RQ3노트 지속시간, 박자선, 음성 교차 오류가 종단간 프레임워크에서 변환 품질에 어떤 영향을 미치는가?
  • RQ4제한된 훈련 데이터와 문법적 제약 조건에도 불구하고, 다양한 음악 스타일(예: 쿠арт렛 대비 차오랄)으로 일반화 가능한가?

주요 결과

  • 쿠ارت렛 테스트 세트에서 모델은 WER 21.02%와 CER 13.53%를 기록하여 복잡한 폴리포닉 음악에서 뛰어난 성능을 보였다.
  • 차오랄 데이터셋에서는 WER 30.96%와 CER 18.10%를 기록했으며, 이는 더 높은 화성과 리듬 복잡도로 인해 오류율이 높아졌음을 반영한다.
  • 주요 오류로는 잘못된 노트 지속시간, 잘못된 박자선 정렬, 특히 음이 가까이 있거나 음성이 교차할 경우 발생하는 오류가 있었다.
  • 연결선과 트리플릿과 같은 드문 기호는 훈련 데이터에서 빈도가 낮고 **kern 형식 표현의 한계로 인해 처리에 어려움을 겪었다.
  • **kern 출력에서 형식 오류가 관찰되어 문법 제약 조건이나 더 다양한 훈련 데이터로 개선 가능할 것임을 시사한다.
  • 한계가 있음에도 불구하고, 단일 신경망을 통한 종단간 음성-점자 변환의 가능성을 입증했으며, 단계 간 오류 전파를 피할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.