Skip to main content
QUICK REVIEW

[논문 리뷰] Rapformer: Conditional Rap Lyrics Generation with Denoising Autoencoders

Nikola I. Nikolov, Eric Malmi|arXiv (Cornell University)|2020. 04. 08.
Music and Audio Processing인용 수 7
한 줄 요약

Rapformer는 뉴스, 영화 줄거리, 기존 랩 가사와 같은 다양한 입력에서 추출한 핵심 어휘를 기반으로, Transformer 기반의 노이즈 제거 오토인코더를 사용해 랩 가사를 조건부로 생성하는 모델을 소개한다. BERT 기반의 약어화 모듈을 통해 평균 랩 밀도를 10% 향상시키며, 인간 수준의 유창성을 달성하여 튜링 테스트에서 전문 평론가들이 25%의 확률로 생성된 가사를 인간이 쓴 것으로 오인한다. 또한 뉴스 기사, 영화 줄거리, 기존 랩 가사 등 다양한 입력 유형에서 내용을 효과적으로 유지하면서 스타일을 전이하는 데 성공한다.

ABSTRACT

The ability to combine symbols to generate language is a defining characteristic of human intelligence, particularly in the context of artistic story-telling through lyrics. We develop a method for synthesizing a rap verse based on the content of any text (e.g., a news article), or for augmenting pre-existing rap lyrics. Our method, called Rapformer, is based on training a Transformer-based denoising autoencoder to reconstruct rap lyrics from content words extracted from the lyrics, trying to preserve the essential meaning, while matching the target style. Rapformer features a novel BERT-based paraphrasing scheme for rhyme enhancement which increases the average rhyme density of output lyrics by 10%. Experimental results on three diverse input domains show that Rapformer is capable of generating technically fluent verses that offer a good trade-off between content preservation and style transfer. Furthermore, a Turing-test-like experiment reveals that Rapformer fools human lyrics experts 25% of the time.

연구 동기 및 목표

  • 기존 랩 가사에서 추출한 핵심 어휘를 기반으로 하여 입력 텍스트의 내용을 유지하면서도 랩 가사의 스타일적 특징을 전이하는 조건부 랩 가사 생성 방법을 개발한다.
  • 주제와 내러티브 방향성에 대한 제어가 없는 무조건적 생성 방식의 한계를 해결한다.
  • 랩의 핵심 스타일적 특징인 랩 밀도를 향상시키기 위해 새로운 후처리 보완 단계를 도입한다.
  • 뉴스 기사, 영화 줄거리, 기존 랩 가사 등 다양한 입력 영역에서 모델 성능을 평가한다.
  • 측정 가능한 인간 평가를 통해 생성된 가사의 현실성 평가를 수행하며, 튜링 테스트 유사 실험을 실시한다.

제안 방법

  • 원래 가사에서 추출한 핵심 어휘 목록을 기반으로 전체 랩 가사를 재구성하는 Transformer 기반의 노이즈 제거 오토인코더를 학습한다.
  • BERT 기반의 약어화 기법을 사용해 끝말이 빗나가는 어휘를 뜻하는 뜻의 어휘로 대체함으로써 평균 랩 밀도를 10% 향상시킨다.
  • 뉴스 요약, 영화 줄거리, 기존 랩 가사 등 다양한 입력 유형에 조건을 걸어 내용 제어가 가능한 생성을 가능하게 한다.
  • 핵심 의미적 내용을 변경하지 않으면서도 랩의 끝말 맞춤 구조를 향상시키는 후처리 단계를 적용한다.
  • 입력이 핵심 어휘의 시퀀스이고 출력이 전체 랩 가사가 되는 시퀀스-투-시퀀스 학습 목표를 사용해 모델을 미세조정한다.
  • 자동 평가 지표(예: 내용 일치도, 유창성)와 인간 평가를 병행하여 성능을 평가하며, 인간이 작성한 가사와의 쌍대 비교도 실시한다.

실험 결과

연구 질문

  • RQ1노이즈 제거 오토인코더 접근 방식이 다양한 입력 텍스트에서 추출한 핵심 어휘를 기반으로 하여 일관성 있고 스타일적으로 정확한 랩 가사를 효과적으로 생성할 수 있는가?
  • RQ2BERT 기반의 리듬 향상 단계가 생성된 가사의 랩 밀도와 인식된 품질에 어느 정도 기여하는가?
  • RQ3모델은 랩 가사의 스타일적 특징을 전이하면서도 입력 텍스트의 의미적 내용을 얼마나 잘 유지하는가?
  • RQ4전문가 평론가들이 튜링 테스트 유사 환경에서 Rapformer가 생성한 가사와 인간이 작성한 가사를 신뢰성 있게 구분할 수 있는가?
  • RQ5뉴스 기사, 영화 줄거리, 기존 랩 가사 등 다양한 입력 영역에서 모델의 내용 충실도와 스타일적 자연스러움 측면에서 성능은 어떠한가?

주요 결과

  • Rapformer는 뉴스 기사, 영화 줄거리, 기존 랩 가사 등 세 가지 다양한 입력 영역에서 내용 보존과 스타일 전이 사이의 균형을 잘 유지하며 기술적으로 자연스러운 랩 가사를 성공적으로 생성한다.
  • BERT 기반의 리듬 향상 단계는 생성된 가사의 평균 랩 밀도를 10% 향상시켜 스타일적 진정성 향상을 이룬다.
  • 튜링 테스트 유사 평가에서 Rapformer는 한 줄씩 제시된 가사 중 전문가 평론가들이 25%의 확률로 인간이 쓴 것으로 오인하였다. 이는 높은 현실성 수준을 의미한다.
  • 한 줄씩 제시된 뉴스 기사 기반으로 생성된 Rapformer의 가사 중 8%가 최소 두 명의 평론가가 인간이 쓴 것으로 잘못 식별하였다.
  • 내용 일치도와 스타일 전이 품질 측면에서, 강력한 정보 검색 기반 베이스라인과 무조건적 생성 기반 베이스라인보다 모델이 뛰어난 성능을 보였다.
  • 특히 기존 랩 가사를 보완하는 데 효과적이며, 일관성 있고 스타일적으로 일관된 변형을 생성하는 데 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.