[논문 리뷰] LP-MusicCaps: LLM-Based Pseudo Music Captioning
이 논문은 음악 태그 데이터를 기반으로 대규모 언어 모델(Large Language Models, LLMs)을 미세조정하여 고품질의 문법적으로 올바른 문장으로 구성된 대규모 가짜 음악 캡션 데이터셋인 LP-MusicCaps를 제안한다. 이 방법은 제로샷 및 전이 학습 설정에서 최신 기술 수준의 성능을 달성하며, BERT-Score와 n-gram 메트릭에서 지도 학습 기반 베이스라인을 능가하면서 일반화 능력 향상과 새로운 캡션 생성 능력을 보여준다.
Automatic music captioning, which generates natural language descriptions for given music tracks, holds significant potential for enhancing the understanding and organization of large volumes of musical data. Despite its importance, researchers face challenges due to the costly and time-consuming collection process of existing music-language datasets, which are limited in size. To address this data scarcity issue, we propose the use of large language models (LLMs) to artificially generate the description sentences from large-scale tag datasets. This results in approximately 2.2M captions paired with 0.5M audio clips. We term it Large Language Model based Pseudo music caption dataset, shortly, LP-MusicCaps. We conduct a systemic evaluation of the large-scale music captioning dataset with various quantitative evaluation metrics used in the field of natural language processing as well as human evaluation. In addition, we trained a transformer-based music captioning model with the dataset and evaluated it under zero-shot and transfer-learning settings. The results demonstrate that our proposed approach outperforms the supervised baseline model.
연구 동기 및 목표
- 모델 훈련 및 평가를 제한하는 대규모 공개 음악 캡션 데이터셋의 부족 문제를 해결한다.
- MusicCaps와 같은 기존 데이터셋의 한계를 극복한다. 기존 데이터셋은 크기가 작고(5,521쌍), 강력한 모델을 훈련시키기에 스케일이 불가능하다.
- 비용이 많이 들지 않는 인간의 수작업을 대체하여 고품질의 음악 캡션을 생성하는 비용 효율적이고 확장 가능한 방법을 개발한다.
- 정신적 일致성, 문법적 정확성, 어휘의 풍부함을 보장하기 위해 LLM이 생성한 음악 캡션에 대한 체계적인 평가 프레임워크를 구축한다.
- 지난 훈련된 모델이 지도 학습 데이터 기반 모델보다 제로샷 및 전이 학습 환경에서도 더 잘 일반화됨을 입증한다.
제안 방법
- 음악 태그를 자연어 문장으로 변환하는 프롬프트를 사용하여 지시 훈련(instruction-tuning)를 통해 대규모 언어 모델(LLM)을 미세조정한다.
- 프롬프트 템플릿을 활용: '다음 태그로 음악을 묘사해 주세요: [tag1, tag2, ...]' — 이는 LLM이 일관되고 기술적인 캡션을 생성하도록 이끈다.
- 대규모 음악 태깅 데이터셋(MagnaTagATune 또는 MSD 등)을 기반으로 LLM을 훈련하여 약 220만 개의 가짜 캡션과 50만 개의 오디오 클립 쌍을 생성한다.
- 생성된 캡션의 의미 일관성, 문법 정확성, 어휘 다양성을 확보하기 위해 체계적인 필터링 절차를 적용한다.
- 감독적 미세조정 및 제로샷 추론을 통해 LP-MusicCaps 데이터셋을 기반으로 트랜스포머 기반 음악 캡션 모델을 훈련시킨다.
- 모델 아키텍처에서 오디오 표현(mel-spectrograms)과 생성된 텍스트 토큰 간의 정렬을 위해 교차 어텐션 메커니즘을 사용하며, 자동회귀적 다음 토큰 예측 최적화를 위해 설계한다.

실험 결과
연구 질문
- RQ1대규모 언어 모델(LLM)은 음악 태그에서 의미적·문법적으로 일관된 자연스러운 음악 캡션을 효과적으로 생성할 수 있는가?
- RQ2LLM 기반으로 생성된 대규모 가짜 음악 캡션 데이터셋은 기존의 소규모 인간 수작업 데이터셋보다 후행 작업에서 더 나은 성능을 보일 수 있는가?
- RQ3LLM 기반 캡션으로 사전 훈련된 모델은 지도 기반 베이스라인 대비 제로샷 및 전이 학습 환경에서 얼마나 잘 일반화되는가?
- RQ4어휘 다양성, 신선도, 의미적 관련성 측면에서 LLM이 생성한 캡션은 인간 수작업 캡션과 비교해 어떤가?
- RQ5LLM의 활용은 음악 캡션 분야에서 데이터 수집의 비용과 시간을 줄일 수 있으며, 이는 모델 성능을 유지하거나 향상시키는 데 기여하는가?
주요 결과
- LP-MusicCaps 데이터셋은 약 220만 개의 캡션-오디오 쌍을 포함하여 음악 캡션 훈련에 사용 가능한 데이터의 규모를 크게 확장했다.
- LP-MusicCaps로 훈련된 모델은 BERT-Score와 대부분의 n-gram 메트릭에서 지도 기반 베이스라인을 능가하며, 특히 제로샷 및 전이 학습 환경에서 두드러진 성능 향상을 보였다.
- LLM 기반 캡션으로 사전 훈련된 모델은 지도 기반 베이스라인 대비 BERT-Score에서 뚜렷한 향상을 보이며, 어휘 일치를 넘어서 의미적 이해가 향상되었음을 시사한다.
- 모델는 높은 Novel c 점수를 통해 강력한 일반화 능력을 보이며, 훈련 데이터를 암기하는 것이 아니라 새로운, 알려지지 않은 캡션을 생성함을 나타낸다.
- LLM 기반의 가짜 캡션 생성 접근법은 고비용의 인간 수작업 데이터 의존도를 줄이면서도, 강력한 음악 캡션 모델 훈련에 적합한 고품질 출력을 유지한다.
- 체계적 평가 결과, LLM이 생성한 캡션은 문법적으로 정확하고 입력 태그와 의미적으로 일관되며, 어휘적으로 풍부하다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.