Skip to main content
QUICK REVIEW

[논문 리뷰] Generation of lyrics lines conditioned on music audio clips

Olga Vechtomova, Gaurav Sahu|arXiv (Cornell University)|2020. 09. 30.
Music and Audio Processing참고 문헌 14인용 수 4
한 줄 요약

이 논문은 음악 오디오 클립을 기반으로 정서적으로 일치하는 가사 줄을 생성하는 이모달 변동형 오토인코더 모델을 제시한다. 스펙트로그램에서 연속 잠재 표현을 학습하고 이를 텍스트 VAE를 조절하는 데 사용함으로써, 입력 오디오의 정서적 분위기와 일치하는 가사를 생성하는 시스템이 되었으며, 자동 평가 및 인간 평가를 통해 음악-가사 일치성 탐지 정확도가 78.3%로 검증되었다.

ABSTRACT

We present a system for generating novel lyrics lines conditioned on music audio. A bimodal neural network model learns to generate lines conditioned on any given short audio clip. The model consists of a spectrogram variational autoencoder (VAE) and a text VAE. Both automatic and human evaluations demonstrate effectiveness of our model in generating lines that have an emotional impact matching a given audio clip. The system is intended to serve as a creativity tool for songwriters.

연구 동기 및 목표

  • 작곡가들이 기반으로 삼을 수 있는 새로운 정서적 공명을 느끼는 가사 줄을 악기 음악 클립 기반으로 생성하는 창의적 도구를 개발하기 위해.
  • 정서적 영향력이 핵심적인 역할을 하는 음악 오디오를 조건으로 삼지 않는 기존 텍스트 생성 모델의 격차를 보완하기 위해.
  • 스펙트로그램-VAE에서 학습한 연속 잠재 변수가 텍스트-VAE를 효과적으로 조절하여 스타일에 맞는 생성을 가능하게 할 수 있는지 탐색하기 위해.
  • 다양한 악기 음악 클립의 정서적 분위기와 일치하는 가사를 생성할 수 있는지 모델의 능력을 평가하기 위해.

제안 방법

  • 10초 분량의 음악 오디오 클립의 스펙트로그램을 인코딩하여 잠재 공간에 연속적인 잠재 표현을 학습하는 스펙트로그램-VAE.
  • 텍스트-VAE 디코더가 스펙트로그램-VAE의 잠재 벡터에 조건을 받음으로써, 오디오의 정서적 및 스타일적 특성과 일치하는 가사를 생성할 수 있음.
  • VAE의 인코더 및 디코더 네트워크에 모두 LSTM을 사용하며, 재구성 손실과 KL 분산 정규화를 적용함.
  • 어휘 유사도 측정을 위해 단어 수준의 KL 분산과 순서 기반 중첩(Rank-Biased Overlap, RBO)을 사용하여 정서 카테고리 내 일관성을 평가함.
  • 인간 평가는 참가자가 동일하거나 반대 정서 카테고리의 두 개의 가사 목록 중에서 주어진 악기 클립과 일치하는 것을 식별하도록 구성됨.
  • 시스템은 'Ghosts I-IV' 앨범의 악기 클립 데이터셋을 사용하여 훈련되었으며, '잔잔함'과 '강렬함'의 두 정서 카테고리로 분할됨.

실험 결과

연구 질문

  • RQ1신경망 모델은 주어진 악기 음악 오디오 클립과 정서적으로 일치하는 가사 줄을 생성할 수 있는가?
  • RQ2스펙트로그램에서 학습한 연속 잠재 표현이 텍스트 생성 모델을 효과적으로 조절하여 스타일 및 정서적으로 일치하는 가사를 생성할 수 있는가?
  • RQ3생성된 가사가 정서 카테고리 내에서(예: '잔잔함' 대비 '강렬함') 어휘 유사도가 카테고리 간보다 더 높은가?
  • RQ4인간 평가자들이 생성된 가사와 조건화된 오디오 클립 간의 정서 일치성을 어느 정도 탐지할 수 있는가?

주요 결과

  • 인간 평가를 통해 입력 오디오와 정서적으로 일치하는 가사를 성공적으로 생성하는 것으로 확인되었으며, 정확도가 78.3%로, 정확한 오디오-가사 쌍 식별에 기여함.
  • '잔잔함' 음악 클립에서 생성된 가사 줄들은 상호 간 평균 RBO 점수 0.45를 기록하여 '강렬함' 클립에서 생성된 가사 줄보다 더 높은 어휘 일관성을 보였음.
  • '강렬함' 클립에서 생성된 가사 줄들은 상호 간 평균 RBO 값이 0.32로 낮아, 훈련 데이터에서 더 다양한 음악적 특징이 존재함에 따라 더 높은 어휘 다양성을 보였음.
  • KL 분산 분석 결과, '잔잔함'과 '강렬함' 카테고리 간 생성된 가사의 단어 분포가 유의미하게 다름을 확인하였으며, 통계적으로 유의미한 dB 차이(p < 0.05)를 보였음.
  • 스펙트로그램-VAE의 연속 잠재 공간은 정서와 가사 스타일에 영향을 주는 음악적 특징을 효과적으로 인코딩하여 텍스트-VAE의 의미 있는 조건화를 가능하게 함.
  • 이전 연구에서 이질적인 텍스트 기반 스타일 임베딩에 의존한 바에 비해, 오디오에서 유도된 연속 임베딩을 사용하여 텍스트 생성을 조건화할 수 있음을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.