Skip to main content
QUICK REVIEW

[논문 리뷰] SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition

Shuangrui Ding, Zihan Liu|arXiv (Cornell University)|2024. 02. 27.
Music and Audio Processing인용 수 4
한 줄 요약

SongComposer는 기호적 노래 표현을 사용하여 일관된 가사와 멜로디를 생성하는 대규모 언어 모델입니다. 이를 통해 텍스트와 음악 간 정밀한 정렬이 가능합니다. 음고, 지속시간, 휴식 지속시간을 위한 전용 토큰화를 도입하고, 대규모 데이터셋(SongCompose-PT)에서 미리 훈련함으로써, 토큰 효율성과 인간이 읽을 수 있는 출력을 바탕으로 GPT-4를 능가하는 성능을 보입니다. 이는 가사에서 멜로디 생성, 멜로디에서 가사 생성, 텍스트에서 노래 생성 작업 전반에서 입니다.

ABSTRACT

Creating lyrics and melodies for the vocal track in a symbolic format, known as song composition, demands expert musical knowledge of melody, an advanced understanding of lyrics, and precise alignment between them. Despite achievements in sub-tasks such as lyric generation, lyric-to-melody, and melody-to-lyric, etc, a unified model for song composition has not yet been achieved. In this paper, we introduce SongComposer, a pioneering step towards a unified song composition model that can readily create symbolic lyrics and melodies following instructions. SongComposer is a music-specialized large language model (LLM) that, for the first time, integrates the capability of simultaneously composing lyrics and melodies into LLMs by leveraging three key innovations: 1) a flexible tuple format for word-level alignment of lyrics and melodies, 2) an extended tokenizer vocabulary for song notes, with scalar initialization based on musical knowledge to capture rhythm, and 3) a multi-stage pipeline that captures musical structure, starting with motif-level melody patterns and progressing to phrase-level structure for improved coherence. Extensive experiments demonstrate that SongComposer outperforms advanced LLMs, including GPT-4, in tasks such as lyric-to-melody generation, melody-to-lyric generation, song continuation, and text-to-song creation. Moreover, we will release SongCompose, a large-scale dataset for training, containing paired lyrics and melodies in Chinese and English.

연구 동기 및 목표

  • 기호 음악 표현을 사용하여 인간처럼 가사와 멜로디를 동시에 작곡할 수 있는 대규모 언어 모델을 개발하는 것.
  • 음성 기반 음악 모델링의 한계를 극복하기 위해, 양자화된 음성 신호가 아닌 구조적이고 인간이 설계한 기호적 표기 방식을 사용하는 것.
  • 새로운 튜플 기반 표현 방식을 통해 가사와 음악 노트 간 정확한 정렬을 가능하게 하는 것.
  • 중국어와 영어로 구성된 대규모 다국어 기반의 쌍화된 가사-멜로디 데이터셋(SongCompose-PT)에서 모델을 미리 훈련시켜 기반 음악 이해 능력을 키우는 것.
  • 다양한 노래 생성 작업을 통합된 프레임워크에서 수행할 수 있도록 10,000개의 정제된 QA 쌍을 통해 지시어 따르기 능력을 향상시키는 것.

제안 방법

  • 모델는 각 가사어를 음고, 지속시간, 휴식 지속시간 등의 음악적 특성과 연결하여 표현하기 위해 새로운 튜플 설계를 사용하며, 의미적 명확성과 정렬을 보장합니다.
  • 음고(예: 'F4'), 지속시간(예: '1.0s'), 휴식 지속시간을 위한 전용 토큰을 도입하여, LLM이 오디오 인코딩 없이도 직접 음악 기호를 해석할 수 있도록 합니다.
  • 280만 개의 가사, 2만 개의 멜로디, 1만 5천 개의 쌍화된 가사-멜로디 세트를 포함하는 SongCompose-PT라는 데이터셋에서 모델을 미리 훈련시어 기초 음악 이해 능력을 구축합니다.
  • 다양한 노래 생성 작업(예: 가사에서 멜로디 생성, 텍스트에서 노래 생성 등)을 포함하는 10,000개의 QA 스타일 대화를 사용하여 지시어 따르기 능력을 피나이팅합니다.
  • 기호적 표현 방식은 오디오 기반 토큰화보다 효율적이고 영리하며 인간이 읽을 수 있는 출력을 가능하게 하여 토큰 수를 줄이고 이해 가능성을 향상시킵니다.
  • 제거 실험을 통해 이산적 지속시간과 노트 토큰화가 정확한 멜로디 생성과 정렬에 필수적임을 입증합니다.
Figure 1: An example of lyrics and melody alignment. It involves ensuring the lyrics precisely match with one or more melody notes, annotated with precise timestamps.
Figure 1: An example of lyrics and melody alignment. It involves ensuring the lyrics precisely match with one or more melody notes, annotated with precise timestamps.

실험 결과

연구 질문

  • RQ1기호적 노래 표현을 사용할 때 대규모 언어 모델이 일관되고 음악적으로 정확한 가사와 멜로디를 효과적으로 생성할 수 있는가?
  • RQ2노래 생성에서 효율성, 정렬 정확도, 성능 측면에서 기호적 표현 방식은 음성 기반 토큰화 방식보다 어떻게 비교되는가?
  • RQ3대규모 다국어 기반 쌍화된 가사-멜로디 데이터셋은 모델이 음악-텍스트 관계를 학습하는 데 어떤 영향을 미치는가?
  • RQ4QA 쌍을 통한 지시어 따르기 튜닝은 모델이 다양한 노래 생성 작업 전반에서 얼마나 다양하게 활용될 수 있는가?
  • RQ5음고, 지속시간, 휴식 지속시간을 위한 전용 토큰화가 멜로디 및 가사 생성 성능 향상에 상당한 기여를 하는가?

주요 결과

  • SongComposer는 GPT-4보다 가사에서 멜로디 생성 작업에서 뛰어난 성능을 보이며, BERT 스코어 0.653과 멜로디 지속시간(MD) 2.05를 기록했고, GPT-4는 각각 0.600과 2.45를 기록했습니다.
  • 미리 훈련 단계에서 순수 가사 데이터와 순수 멜로디 데이터를 모두 포함함으로써 최고의 성능을 달성하였으며, 이는 모델 학습에서 상호보완적 효과가 있음을 보여줍니다.
  • 이산적 지속시간 토큰화는 멜로디에서 가사 생성 작업에서 BERT 스코어를 0.03 이상 향상시켜, 음악의 구조적 이해에 있어 중요성을 확인합니다.
  • 전용 노트 토큰화는 가사에서 멜로디 생성 및 멜로디에서 가사 생성 작업 양쪽에서 성능 향상을 크게 높이며, 명확성과 학습 효율성을 향상시킵니다.
  • 완전한 토큰화(음고, 지속시간, 휴식)를 사용할 경우 출력 형식이 정확한 경우가 100%였지만, 생략 시 형식 오류가 발생하여 실패했습니다.
  • 제거 실험을 통해 명시적인 음악적 특성을 포함한 기호적 표현 방식이 암묵적인 오디오 기반 모델링보다 더 정확하고 효율적인 노래 생성을 가능하게 함을 확인했습니다.
Figure 2: Pipeline of paired lyric-melody data collection.
Figure 2: Pipeline of paired lyric-melody data collection.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.