Skip to main content
QUICK REVIEW

[논문 리뷰] MuseMorphose: Full-Song and Fine-Grained Music Style Transfer with Just One Transformer VAE.

Shih-Lun Wu, Yi‐Hsuan Yang|arXiv (Cornell University)|2021. 05. 10.
Music and Audio Processing참고 문헌 72인용 수 7
한 줄 요약

MuseMorphose는 리듬 강도와 다성성과 같은 시간에 따라 변화하는 세그먼트 수준의 속성을 조건으로 삼아 전곡 및 세밀한 음악 스타일 전이를 가능하게 하는 통합형 트랜스포머 기반 VAE 모델을 제안한다. VAE 목표 아래에서 트랜스포머 인코더와 인-어텐션 디코더를 통합함으로써, 스타일 전이 평가 지표에서 RNN 기반 베이스라인보다 뛰어난 성능을 달성한다.

ABSTRACT

Transformers and variational autoencoders (VAE) have been extensively employed for symbolic (e.g., MIDI) domain music generation. While the former boast an impressive capability in modeling long sequences, the latter allow users to willingly exert control over different parts (e.g., bars) of the music to be generated. In this paper, we are interested in bringing the two together to construct a single model that exhibits both strengths. The task is split into two steps. First, we equip Transformer decoders with the ability to accept segment-level, time-varying conditions during sequence generation. Subsequently, we combine the developed and tested in-attention decoder with a Transformer encoder, and train the resulting MuseMorphose model with the VAE objective to achieve style transfer of long musical pieces, in which users can specify musical attributes including rhythmic intensity and polyphony (i.e., harmonic fullness) they desire, down to the bar level. Experiments show that MuseMorphose outperforms recurrent neural network (RNN) based baselines on numerous widely-used metrics for style transfer tasks.

연구 동기 및 목표

  • 트랜스포머의 장거리 시퀀스 모델링 능력과 변동형 오토인코더의 제어 가능성의 강점을 상징적 음악 생성에서 통합하기 위해.
  • 사용자가 지정한 시간에 따라 변화하는 음악적 속성—예를 들어 리듬 강도와 다성성—을 생성 과정 내내 바 수준에서 제어할 수 있도록 하기 위해.
  • 단일 엔드 투 엔드 모델을 개발하여 상징적 음악에서 전곡 생성과 세밀한 스타일 전이를 모두 지원하기 위해.
  • 표준화된 스타일 전이 평가 지표에서 기존의 RNN 기반 방법들을 능가하기 위해.

제안 방법

  • 모델은 자동회귀적 생성 중에 세그먼트 수준의 시간에 따라 변화하는 제어 벡터를 조건으로 삼기 위해 인-어텐션 메커니즘을 강화한 트랜스포머 디코더를 활용한다.
  • 개별 트랜스포머 인코더가 입력 음악 시퀀스를 처리하고 VAE 목표 아래에서 잠재 표현을 생성한다.
  • 잠재 공간이 분리되어 바 수준에서 다성성과 리듬 강도와 같은 특정 음악적 속성에 대한 제어가 가능하도록 한다.
  • 모델은 엔드 투 엔드로 VAE 목표를 사용하여 훈련되며, 재구성과 분리된 샘플링을 가능하게 하여 스타일 전이를 지원한다.
  • 제어 벡터가 디코더 어텐션 메커니즘에 통합되어 각 토큰 단계에서 생성을 조절함으로써 세밀한 스타일 편집이 가능하다.

실험 결과

연구 질문

  • RQ1단일 트랜스포머 기반 모델이 상징적 음악에서 장거리 시퀀스 모델링과 세밀한 사용자 제어 스타일 전이를 효과적으로 통합할 수 있는가?
  • RQ2시간에 따라 변화하는 세그먼트 수준의 제어 벡터가 음악 생성의 표현력과 제어 가능성에 얼마나 기여하는가?
  • RQ3다양한 평가 지표에서 제안된 모델은 RNN 기반 베이스라인과 비교해 스타일 전이 품질 측면에서 어떠한 차이를 보이는가?
  • RQ4모델은 바 수준에서 다성성과 리듬 강도와 같은 서로 다른 음악적 속성을 독립적으로 분리하고 조작할 수 있는가?

주요 결과

  • MuseMorphose는 널리 사용되는 여러 스타일 전이 지표에서 RNN 기반 베이스라인을 능가하며, 뛰어난 생성 품질을 입증한다.
  • 모델은 리듬 강도와 다성성과 같은 음악적 속성에 대해 바 수준의 세밀한 제어를 성공적으로 가능하게 한다.
  • 트랜스포머 디코더에 인-어텐션 조건부 조절을 통합함으로써 자동회귀적 생성 중 효과적이고 안정적인 제어 주입이 가능해졌다.
  • VAE 목표 덕분에 분리된 잠재 표현이 구현되어 의미 있고 해석 가능한 스타일 전이를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.