Skip to main content
QUICK REVIEW

[논문 리뷰] Generating lyrics with variational autoencoder and multi-modal artist embeddings

Olga Vechtomova, Hareesh Bahuleyan|arXiv (Cornell University)|2018. 12. 20.
Music and Audio Processing참고 문헌 9인용 수 14
한 줄 요약

이 논문은 특정 아티스트의 스타일을 반영하는 가사 생성을 위한 다중 모odal 아티스트 임베딩을 갖춘 변분 오토에인코더(VAE)를 제안한다. MEL 스펙트로그램에서 아티스트를 예측하는 CNN 분류기를 사용하여 아티스트 임베딩을 사전 훈련시키며, 음성 기반 표현을 통해 임베딩을 초기화할 경우 텍스트 생성에서 스타일 조건화가 향상됨을 입증한다.

ABSTRACT

We present a system for generating song lyrics lines conditioned on the style of a specified artist. The system uses a variational autoencoder with artist embeddings. We propose the pre-training of artist embeddings with the representations learned by a CNN classifier, which is trained to predict artists based on MEL spectrograms of their song clips. This work is the first step towards combining audio and text modalities of songs for generating lyrics conditioned on the artist's style. Our preliminary results suggest that there is a benefit in initializing artists' embeddings with the representations learned by a spectrogram classifier.

연구 동기 및 목표

  • 특정 아티스트의 스타일적 특성에 조건화된 가사 생성 시스템을 개발하는 것.
  • 스펙트로그램에서 학습한 아티스트 임베딩을 통해 음성과 텍스트 모odal 간의 다중 모달 연결을 구축하는 것.
  • 음성 표현을 사용해 아티스트 임베딩을 사전 훈련시키면 가사 생성 품질이 향상되는지 조사하는 것.
  • 개인화된 가사 생성을 위한 다중 모달 학습(음성 + 텍스트)의 가능성을 탐색하는 것.
  • 음성 기반 표현이 생성된 가사의 스타일 분리성과 품질에 어떤 영향을 미치는지 평가하는 것.

제안 방법

  • 스타일 조건화된 가사를 생성하기 위해 변분 오토에인코더(VAE)를 사용한다.
  • 사전 훈련된 CNN 분류기에서 추출한 특징을 사용해 아티스트 임베딩을 초기화한다. 이 CNN 분류기는 가요 클립의 MEL 스펙트로그램을 기반으로 아티스트를 예측하도록 훈련된다.
  • VAE는 텍스트 시퀀스(가사)와 사전 훈련된 아티스트 임베딩을 함께 사용해 스타일 조건화된 생성을 학습하도록 미세조정된다.
  • 다중 모달 조건화는 음성 기반 표현과 텍스트 시퀀스 모델링을 결합하여 스타일 전이를 구현한다.
  • 사전 훈련된 음성 임베딩을 활용해 훈련 중에 보지 못한 아티스트의 스타일로도 제로샷 가사 생성이 가능해진다.

실험 결과

연구 질문

  • RQ1스펙트로그램 표현이 생성된 가사의 품질과 스타일 충실도를 향상시키는가?
  • RQ2음성 데이터를 사용해 아티스트 임베딩을 사전 훈련시키면 스타일 조건화된 가사 생성 성능이 향상되는가?
  • RQ3오직 음성 임베딩만을 사용해 VAE 모델이 특정 아티스트의 스타일적 뉘앙스를 얼마나 잘 반영할 수 있는가?
  • RQ4음성과 텍스트 모달의 융합이 아티스트 특화된 언어 스타일 학습에 얼마나 효과적인가?
  • RQ5학습 중에 보지 못한 아티스트에게도 학습된 음성 기반 표현을 활용해 일반화가 가능한가?

주요 결과

  • 스펙트로그램 분류기를 사용해 아티스트 임베딩을 사전 훈련시키면 생성된 가사의 스타일 조건화가 향상된다.
  • 품질 분석 결과, 시스템은 목표 아티스트의 스타일적 특성을 반영한 가사 라인을 성공적으로 생성한다.
  • 아티스트 임베딩에 음성 기반 표현을 사용할 경우 VAE에서 스타일과 콘텐츠의 분리성이 향상된다.
  • 음성과 텍스트 데이터를 결합한 다중 모달 학습의 가능성이 음악 가사 생성 분야에서 입증된다.
  • 초기 결과에 따르면 음성 기반 표현은 아티스트 특화된 스타일 패턴을 포착하며, 이는 텍스트 생성으로 이식 가능하다.
  • 이 접근은 음악 생성에서 음성과 텍스트 모달을 공동으로 모델링하는 데 있어 첫 걸음이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.