[논문 리뷰] The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation
Song Describer Dataset(SDD)는 706개의 공개 라이선스가 부여된 음악 트랙(각각 2분 길이)에 대해 고품질의 자연어 설명을 1,106건 수록한 공동 제작 코퍼스로, 음악-언어 모델의 표준화된 평가를 위해 설계되었습니다. 이 데이터셋은 음악 캡션 생성, 텍스트-음악 생성, 음악-언어 검색 분야에서의 교차 데이터셋 벤치마킹을 가능하게 하며, 도메인 외 평가의 중요성을 강조하고, 비공개 또는 합성 데이터에 대한 의존도를 줄입니다.
We introduce the Song Describer dataset (SDD), a new crowdsourced corpus of high-quality audio-caption pairs, designed for the evaluation of music-and-language models. The dataset consists of 1.1k human-written natural language descriptions of 706 music recordings, all publicly accessible and released under Creative Common licenses. To showcase the use of our dataset, we benchmark popular models on three key music-and-language tasks (music captioning, text-to-music generation and music-language retrieval). Our experiments highlight the importance of cross-dataset evaluation and offer insights into how researchers can use SDD to gain a broader understanding of model performance.
연구 동기 및 목표
- 음악-언어 모델 평가를 위한 공개 접근이 가능하고 고품질인 음악-캡션 데이터셋의 부족을 해결하기 위해.
- 모델 평가에 편향과 데이터 泄露를 유발할 수 있는 비공개 또는 합성 데이터에 대한 의존도를 줄이기 위해.
- 실제 음악과 언어 쌍의 다양하고 대표적이며 지속 가능한 데이터셋을 제공함으로써 표준화되고 교차 데이터셋 평가가 가능한 환경를 조성하기 위해.
- 도메인 외 평가를 통해 강건하고 일반화 능력이 뛰어난 음악-언어 모델 개발을 지원하기 위해.
- 미래의 데이터 기여와 데이터셋 확장에 적합한 지속 가능하고 커뮤니티 주도의 플랫폼을 제공하기 위해.
제안 방법
- 비공개 데이터셋이 아닌, 다양한 지리적 및 언어적 배경을 가진 비전문가 자원자들을 대상으로 한 오픈소스 온라인 애너테이션 플랫폼을 통해 데이터셋을 수집함.
- MTG-Jamendo 데이터셋의 2분 길이 음악 트랙을 청취한 참가자들이 악기, 장르, 분위기, 스타일 등을 포함한 음악적 요소에 중점을 두고 단일 문장의 자연어 기술문을 작성함.
- 모든 오디오 파일은 크리에이티브 커먼즈 라이선스를 적용하고 지속적으로 호스팅되어 있어 데이터 접근성과 데이터 드리프트 또는 손실의 위험을 줄임.
- 데이터셋에는 1개 트랙당 다수의 캡션을 포함한 트랙이 25% 포함되어 있어 BLEU, METEOR, CIDEr와 같은 자동 캡션 평가 지표를 사용한 평가가 가능함.
- 데이터셋은 CC BY-SA 4.0 라이선스로 배포되며, 오디오 파일은 원본 라이선스를 유지하고, 지속 가능한 접근성을 확보하기 위해 Zenodo에 배포되고 DOI를 부여함.
- 미래 기여를 위한 공개 웹 인터페이스가 제공되며, 향후 버전은 검증을 거쳐 업데이트된 배포판에 통합될 수 있음.
실험 결과
연구 질문
- RQ1음악-언어 작업에서 모델 성능이 다양한 평가 데이터셋, 특히 도메인 외부 데이터를 사용할 경우 어떻게 달라지나?
- RQ2비공개 또는 합성 벤치마크에 비해 Song Describer Dataset이 음악-언어 모델 평가의 신뢰성과 일반화 능력을 얼마나 향상시킬 수 있는가?
- RQ3다양하고 실제 세계의 데이터셋에 대해, 각 트랙당 다수의 인간 애너테이터가 기입한 기술문이 포함된 경우, 자동 캡션 평가 지표는 어떻게 성능을 보이는가?
- RQ4데이터 지속성과 라이선싱은 음악-언어 평가 데이터셋의 재현 가능성과 장기적 이용 가능성에 어떤 영향을 미치는가?
- RQ5커뮤니티 주도의 캐니버스 기반 데이터 수집 방식은 엄격한 모델 평가에 적합한 고품질이고 대표적인 음악-캡션 쌍을 생성할 수 있는가?
주요 결과
- Song Describer Dataset는 706개의 음악 트랙에 대해 총 1,106건의 인간이 작성한 캡션을 포함하고 있으며, 95%의 트랙이 2분 길이로, MusicCaps나 YT8M-MusicTextClips와 같은 이전 데이터셋보다 훨씬 긴 오디오 세그먼트를 제공함.
- 이 데이터셋은 CC BY-SA 4.0 라이선스로 공개되어 있으며, 모든 오디오 파일도 공개 라이선스를 적용하고 Zenodo에 배포되어 있어 장기적인 데이터 지속성과 접근성 보장.
- 25%의 트랙이 서로 다른 애너테이터가 작성한 다수의 캡션을 포함하고 있어, BLEU, METEOR, CIDEr와 같은 표준 자동 캡션 평가 지표를 활용한 견고한 평가가 가능함.
- SDD는 AudioSet이나 유튜브 기반 오디오에 의존하는 이전 벤치마크에서 흔히 발생하는 데이터 泄露 위험을 완화함. SDD는 라이선스가 확인된 오픈 라이선스를 가진 MTG-Jamendo 데이터셋의 음악을 사용함.
- 저자들은 SDD를 활용한 교차 데이터셋 평가가 특정 훈련 데이터 분포에 과적합되는 것을 줄이며 더 신뢰성 있고 일반화 능력이 뛰어난 모델 성능 평가를 가능하게 함을 입증함.
- 미래의 기여는 공개 웹 인터페이스를 통해 지원되며, GitHub와 Zenodo를 통한 검증 및 버전 관리 기반의 커뮤니티 주도 확장 및 업데이트 경로가 명확히 정의되어 있음.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.