Skip to main content
QUICK REVIEW

[논문 리뷰] Musical Composition Style Transfer via Disentangled Timbre Representations

Yun-Ning Hung, I-Tung Chiang|arXiv (Cornell University)|2019. 05. 30.
Music and Audio Processing참고 문헌 23인용 수 5
한 줄 요약

이 논문은 적대적 훈련을 사용하여 다성분 음악에서 톤과 음고 표현을 분리함으로써 음악적 구성 스타일 전이를 위한 딥러닝 프레임워크를 제안한다. 모델은 악기 활성도 검출에서 최신 기술 성능을 달성하며, 음고 내용을 유지하면서 톤을 조작함으로써 고품질의 음악 재편곡을 가능하게 하여 스트링, 피아노, 밴드와 같은 장르 간 효과적인 스타일 전이를 입증한다.

ABSTRACT

Music creation involves not only composing the different parts (e.g., melody, chords) of a musical work but also arranging/selecting the instruments to play the different parts. While the former has received increasing attention, the latter has not been much investigated. This paper presents, to the best of our knowledge, the first deep learning models for rearranging music of arbitrary genres. Specifically, we build encoders and decoders that take a piece of polyphonic musical audio as input and predict as output its musical score. We investigate disentanglement techniques such as adversarial training to separate latent factors that are related to the musical content (pitch) of different parts of the piece, and that are related to the instrumentation (timbre) of the parts per short-time segment. By disentangling pitch and timbre, our models have an idea of how each piece was composed and arranged. Moreover, the models can realize "composition style transfer" by rearranging a musical piece without much affecting its pitch content. We validate the effectiveness of the models by experiments on instrument activity detection and composition style transfer. To facilitate follow-up research, we open source our code at https://github.com/biboamy/instrument-disentangle.

연구 동기 및 목표

  • 음고 내용을 유지하면서 악기 편성을 변경하는 자동 음악 재편곡을 위한 통합 신경망 모델을 개발하는 것.
  • 잠재 공간 내에서 톤과 음고 요소를 분리함으로써 음악 스타일 전이에 대한 일반화된 모델의 부족을 해결하는 것.
  • 모든 목표 스타일에 대해 쌍화된 데이터가 필요 없이 오직 오디오와 MIDI 쌍만을 사용하여 구성 스타일 전이를 가능하게 하는 것.
  • 적대적 훈련과 음고 인식 모델링을 통해 분리된 표현을 학습함으로써 음악 재편곡 품질을 향상시키는 것.
  • 코드를 오픈소스로 제공하고 데모 결과를 제시함으로써 향후 연구를 촉진하는 것.

제안 방법

  • 모델은 다성분 오디오를 MIDI 점수로 변환하기 위해 U-Net 기반 인코더-디코더 아키텍처를 사용하며, 각 노트의 음고와 악기를 예측한다.
  • 분리 능력은 적대적 훈련을 통해 달성되며, 여기서 구분자는 잠재 공간 내에서 톤 관련 요소와 음고 관련 요소를 구분하도록 훈련된다.
  • 모델은 MIDI 애너테이션을 활용해 음고 및 악기 예측을 감독함으로써 음고와 톤 표현의 공동 학습을 가능하게 한다.
  • 잠재 코드 상에서 별도의 악기 분류기를 훈련시켜 적대적 손실을 통해 톤의 분리를 추가로 강화한다.
  • 스타일 전이를 위해 음고 관련 잠재 요소는 고정하고 톤 관련 요소만 수정하여 새로운 악기 편성을 생성한다.
  • 모델을 종합적으로 최적화하기 위해 복원 손실, 음고 분류 손실, 적대적 손실의 조합을 사용한다.

실험 결과

연구 질문

  • RQ1오디오와 MIDI 쌍에서 효과적으로 분리된 톤 표현을 학습할 수 있는가? 이는 음악 재편곡을 가능하게 하는가?
  • RQ2적대적 훈련이 신경 음악 전사에서 톤과 음고 요소의 분리를 향상시키는가?
  • RQ3음고 내용을 변경하지 않고 음악적 구성 스타일 전이가 얼마나 잘 이루어지는가?
  • RQ4기존 연구 대비 악기 활성도 검출 성능에서 모델은 어떤 성능을 보이는가?
  • RQ5스트링, 피아노, 악기, 밴드 구성과 같은 다양한 음악 장르 간에서 모델이 일반화되는가?

주요 결과

  • 제안된 UnetED 모델은 M&M 데이터셋에서 악기 활성도 검출에서 최신 기술 성능을 달성하며 기존 방법을 능가한다.
  • 적대적 훈련은 분리 능력을 크게 향상시켜 악기 활성도 검출 및 음악 재편곡 성능 모두에 유의미한 개선을 이끌어냈다.
  • 인간 평가를 통해 12개의 소스-타겟 스타일 쌍에서 UnetED는 아블레이티드 버전보다 더 리듬적이고 화성적인 재편곡을 생성함을 확인했다.
  • 전문가와 비전문가 모두가 UnetED의 성능을 Hadad 등(2018)의 베이스라인 방법보다 더 높게 평가했으며, 이는 음고 정보를 유지하지 못하고 빈 트랙이 다수 발생한 결과를 보였다.
  • 모델은 노트에 적절한 악기를 할당하는 데 성공했다—예를 들어 저음에는베이스, 멜로디에는 바이올린이나 플루트를 할당함으로써 재편곡 과정에서 효과적인 악기 선택을 보였다.
  • 전문가와 비전문가 간 평가 점수에 유의미한 차이가 없었으며, 이는 모델 출력이 광범위한 청취자에게 청각적으로 타당하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.