Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Interpretable Polyphonic Transcription with Invertible Neural Networks

Rainer Kelz, Gerhard Widmer|arXiv (Cornell University)|2019. 09. 04.
Music and Audio Processing참고 문헌 35인용 수 7
한 줄 요약

이 논문은 해석 가능한 다성음 음악 변환을 위한 역가능 신경망(INNs)을 소개한다. 이는 학습된 표현을 직접 점검하고 기호적 노트 출력을 생성할 수 있도록 한다. MAPS 데이터셋에서 훈련한 결과, 고립된 음들—특히 극단적인 옥타브에서의 음들—은 다성음 훈련 데이터에서 신뢰성 있게 분리될 수 없음을 드러내며, 현재 신경망 음악 변환 시스템의 핵심 한계를 폭 드러낸다.

ABSTRACT

We explore a novel way of conceptualising the task of polyphonic music transcription, using so-called invertible neural networks. Invertible models unify both discriminative and generative aspects in one function, sharing one set of parameters. Introducing invertibility enables the practitioner to directly inspect what the discriminative model has learned, and exactly determine which inputs lead to which outputs. For the task of transcribing polyphonic audio into symbolic form, these models may be especially useful as they allow us to observe, for instance, to what extent the concept of single notes could be learned from a corpus of polyphonic music alone (which has been identified as a serious problem in recent research). This is an entirely new approach to audio transcription, which first of all necessitates some groundwork. In this paper, we begin by looking at the simplest possible invertible transcription model, and then thoroughly investigate its properties. Finally, we will take first steps towards a more sophisticated and capable version. We use the task of piano transcription, and specifically the MAPS dataset, as a basis for these investigations.

연구 동기 및 목표

  • 신경망 음악 변환 모델의 해석 가능성 부족 문제, 특히 모델이 개별 음의 분리된 표현을 학습하는지 여부를 해결하기 위해.
  • 역가능 신경망(INNs)이 음악 변환에서 판별적 모델링과 생성적 모델링을 통합할 수 있는지, 그리고 모델 행동을 직접 점검할 수 있는지 탐구하기 위해.
  • 단일 고립 음의 개념이 다성음 코퍼스에서만 학습했을 때 실제로 학습될 수 있는지, INNs를 활용해 이러한 음을 생성하고 평가함으로써 평가하기 위해.
  • 모델 역행과 샘플링을 통해 레이블이 없는 데이터에서 모호하거나 불확실한 예측을 식별하는 방법을 제공하기 위해.
  • INNs를 활용해 스타일 전이 및 소스 분離와 같은 후속 MIR 작업의 가능성을 탐색하기 위해.

제안 방법

  • 모델은 크기 스펙트로그램 입력을 분리된 출력으로 매핑하기 위해 역가능 신경망(INN)을 사용한다: 의미적 부분(y, 변환)과 부수적 부분(z), 둘 다 동일한 파라미터를 공유한다.
  • INN은 원본 입력 스펙트로그램과 y와 z로부터 재구성된 출력 사이의 재구성 오차를 최소화하도록 훈련되어, 이중사상 매핑을 보장한다.
  • 해석 가능성 확보를 위해, 표준 정규분포에서 z를 샘플링하고 특정 y 값(예: 단일 음)에 조건을 주어 합성 오디오 샘플을 생성한다.
  • 생성된 샘플과 기준 고립 음 녹음 간의 프레임 단위 유클리드 거리를 계산하고, 분位수 평균을 내어 정밀도를 평가한다.
  • 모델은 MAPS 데이터셋에서 평가되며, 프레임 단위 및 시간적 맥락을 고려한 RevNet 아키텍처를 모두 사용한다. 성능은 재구성 오차와 청각 유사도로 측정된다.
  • 모델 역행을 통해 예측을 역행하고 입력 데이터를 재구성함으로써 모델 행동을 직접 시각화할 수 있으며, 어떤 입력이 어떤 출력을 낳는지 점검할 수 있다.

실험 결과

연구 질문

  • RQ1역가능 신경망은 다성음 변환 모델이 개별 음을 어떻게 인코딩하는지 해석하는 데 사용될 수 있으며, 얼마나 잘 분리된 표현을 학습하는가?
  • RQ2다성음 음악으로만 훈련된 모델이 고립된 음을 얼마나 잘 표현할 수 있는가? 이를 생성 및 기준 녹음과의 비교를 통해 검증한다.
  • RQ3재구성 품질과 샘플링 행동을 분석함으로써, 모델은 레이블이 없는 데이터에서 예측이 모호하거나 불확실한 경우를 식별하고 경고할 수 있는가?
  • RQ4RevNets를 통해 시간적 맥락을 통합하면, 프레임 단위 모델 대비 변환 성능이나 해석 가능성에서 측정 가능한 향상이 이루어지는가?
  • RQ5동일한 모델이 변환 시스템과 합성기로 동시에 기능할 수 있는가? 의미적 개념 샘플링과 스타일 전이를 가능하게 하는가?

주요 결과

  • 모델은 재구성 오차가 극히 낮은 수준으로 원본 스펙트로그램을 재구성하여, 학습된 매핑의 역가능성과 안정성을 확인한다.
  • 고립 음에 대해 생성된 샘플은 일반적인 테이트에서 높은 정밀도를 보이지만, 희귀하거나 극단적인 음, 특히 가장 낮고 높은 옥타브에서의 음은 상당한 편차를 보인다.
  • 생성된 음과 기준 음 간의 프레임 단위 거리의 사분위수 범위 분석 결과, 극단적인 음역대의 음은 잘 재구성되지 않음을 확인하여, 다성음 데이터에서 이러한 개념을 학습하지 못함을 시사한다.
  • INN의 사용은 모델 행동을 직접 점검할 수 있도록 한다: 잠재공간에서 샘플링을 통해 모델이 개별 음의 의미적이고 분리된 표현을 학습했는지 관찰할 수 있다.
  • RevNets를 통한 시간적 맥락 통합은 성능이나 해석 가능성에서 측정 가능한 향상 없이, 모델 복잡도 증가와 충분한 훈련 데이터 부족으로 인해 성능 향상이 이루어지지 않았다.
  • 의미적 출력 y를 수정하고 재역행함으로써 의미적 개념 샘플링과 스타일 전이가 가능해지며, 이는 변환을 넘어서 MIR 작업 전반에 걸쳐 광범위한 적용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.