[논문 리뷰] MidiCaps: A Large-Scale MIDI Dataset With Text Captions
이 논문은 인간과 유사한 텍스트 설명이 첨부된 168,407개의 MIDI 파일로 구성된 대규모 개방형 데이터셋인 MidiCaps를 소개한다. Claude-3 LLM을 사용한 인라인 학습을 통해 추출된 음악 특징—예를 들어 템포, 코드 진행, 장르, 분위기 등—기반으로 기술적 설명 문장을 생성하며, 听음 연구에서 높은 수준의 일치도를 보이며, 텍스트 기반 MIDI 생성 및 다중 모odal 음악 이해 연구를 가능하게 한다.
Generative models guided by text prompts are increasingly becoming more popular. However, no text-to-MIDI models currently exist due to the lack of a captioned MIDI dataset. This work aims to enable research that combines LLMs with symbolic music by presenting, the first openly available large-scale MIDI dataset with text captions. MIDI (Musical Instrument Digital Interface) files are widely used for encoding musical information and can capture the nuances of musical composition. They are widely used by music producers, composers, musicologists, and performers alike. Inspired by recent advancements in captioning techniques, we present a curated dataset of over 168k MIDI files with textual descriptions. Each MIDI caption describes the musical content, including tempo, chord progression, time signature, instruments, genre, and mood, thus facilitating multi-modal exploration and analysis. The dataset encompasses various genres, styles, and complexities, offering a rich data source for training and evaluating models for tasks such as music information retrieval, music understanding, and cross-modal translation. We provide detailed statistics about the dataset and have assessed the quality of the captions in an extensive listening study. We anticipate that this resource will stimulate further research at the intersection of music and natural language processing, fostering advancements in both fields.
연구 동기 및 목표
- 텍스트 기반 MIDI 모델 훈련을 위한 대규모 개방형 캡션 처리된 MIDI 데이터셋의 부족을 해결하기 위해.
- 기호 음악을 위한 고품질 기술적 설명 문장을 제공하여 텍스트 유도 음악 생성 연구를 가능하게 하기 위해.
- 정확하고 자연스러운 듣기 흐름을 갖춘 MIDI 파일에 대한 캡션을 자동으로 생성할 수 있는 확장 가능한 프레임워크를 개발하기 위해.
- AI가 생성한 캡션과 인간이 작성한 캡션을 비교하는 철저한 听음 연구를 통해 캡션 품질을 검증하기 위해.
- 미래의 음악 이해, 음악 정보 검색, 음악에 적용된 다중 모달 LLM 연구를 위한 기반을 마련하기 위해.
제안 방법
- 원천 코퍼스로 사용하기 위해 Lakh MIDI 데이터셋에서 168,407개의 MIDI 파일을 추출하였다.
- 최신 음악 정보 처리(MIR) 도구를 사용해 템포, 시간 signatures, 코드 진행, 악기 존재 여부, 장르, 분위기 등 음악 전용 특징을 자동으로 추출하였다.
- Claude-3 LLM을 사용한 인라인 학습을 활용한 프롬프트 엔지니어링 프레임워크를 설계하여, 소량의 전문가가 코멘터리한 예시와 함께 추출된 특징 기반으로 캡션을 생성하였다.
- 일致성과 기술적 풍부함을 향상시키기 위해 500개의 특징-캡션 쌍으로 구성된 정제된 세트를 사용해 LLM의 인라인 행동을 피지컬 튜닝하였다.
- 두 단계 평가를 적용: 먼저 23명의 참가자(일반 청취자 16명, 음악 전문가 7명)를 대상으로 7개 차원에서 캡션 품질을 평가하기 위한 听음 연구를 실시하였다.
- 전반적인 일치도, 인간다움, 장르, 분위기, 키, 코드, 템포 일치도 등 7개 항목에 대해 7점 리커트 척도를 사용해 캡션 품질을 평가하였다.

실험 결과
연구 질문
- RQ1대규모 언어 모델이 소량의 인라인 예시만을 사용해 MIDI 파일에 대해 고품질 기술적 설명 캡션을 생성할 수 있는가?
- RQ2AI가 생성한 캡션은 템포, 코드 진행, 장르, 분위기 등의 핵심 속성에서 실제로 MIDI 파일의 음악적 내용과 얼마나 잘 일치하는가?
- RQ3인간이 작성한 캡션과 비교해 AI가 생성한 캡션은 인식 품질과 음악적 정확도 측면에서 어떻게 다른가?
- RQ4자동화된 캡션 프레임워크가 대규모로 자연스럽고 음악적으로 일관된 설명을 얼마나 잘 생성할 수 있는가?
- RQ5완전한 인간 레이블링 없이도 합성 캡션 파이프라인으로 인간 수준의 청각적 일치도를 달성할 수 있는가?
주요 결과
- 일반 청취자들 사이에서 AI가 생성한 캡션의 평균 전반적 일치도 점수는 5.63(7점 만점)으로, 인간이 작성한 캡션(5.46)을 略로 뛰어넘었다.
- 음악 전문가들은 AI 캡션의 전반적 일치도를 4.92로 평가했으며, 이는 인간이 작성한 캡션(5.40)과 비교해도 강력한 성능을 보였다.
- 인간다움 측면에서 일반 청취자는 AI 캡션을 5.32로 평가했고, 인간 기준점인 5.21과 유사했으며, 음악 전문가들은 4.98로 평가해 인간 기준점(5.09)과 유사했다.
- 템포 일치도에서는 AI 캡션의 점수가 일반 청취자 기준 5.86, 전문가 기준 5.77로 인간 캡션을 뛰어넘었다.
- 코드 일치도에서는 음악 전문가들이 AI 캡션을 5.09로 평가했고, 인간 기준점(5.74)보다 略로 낮았지만, 복잡한 코드 진행을 요약하는 데 있어 내재된 어려움을 감안하면 여전히 강력한 일치도를 보였다.
- 청각 연구를 통해 캡션들이 MIDI 파일과 청각적으로 일치하며 자연스러운 어조를 지닌다는 것이 확인되었으며, 이는 향후 음악-AI 응용 분야에서 프레임워크의 타당성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.