[論文レビュー] MidiCaps: A Large-Scale MIDI Dataset With Text Captions
本稿では、168,407件のMIDIファイルと人間らしいテキストキャプションをペアにした、初めての大規模オープンデータセットMidiCapsを紹介する。Claude-3 LLMを用いたコンテキスト内学習により、テンポ、コード進行、ジャンル、ムードなどの抽出された音楽特徴に基づいて記述的なキャプションを生成する。聴取実験において高品質な一致を示し、テキストからMIDIへの生成やクロスモodal音楽理解分野の研究を可能にする。
Generative models guided by text prompts are increasingly becoming more popular. However, no text-to-MIDI models currently exist due to the lack of a captioned MIDI dataset. This work aims to enable research that combines LLMs with symbolic music by presenting, the first openly available large-scale MIDI dataset with text captions. MIDI (Musical Instrument Digital Interface) files are widely used for encoding musical information and can capture the nuances of musical composition. They are widely used by music producers, composers, musicologists, and performers alike. Inspired by recent advancements in captioning techniques, we present a curated dataset of over 168k MIDI files with textual descriptions. Each MIDI caption describes the musical content, including tempo, chord progression, time signature, instruments, genre, and mood, thus facilitating multi-modal exploration and analysis. The dataset encompasses various genres, styles, and complexities, offering a rich data source for training and evaluating models for tasks such as music information retrieval, music understanding, and cross-modal translation. We provide detailed statistics about the dataset and have assessed the quality of the captions in an extensive listening study. We anticipate that this resource will stimulate further research at the intersection of music and natural language processing, fostering advancements in both fields.
研究の動機と目的
- テキストからMIDIへのモデルを学習するための、大規模でオープンでキャプション付きのMIDIデータセットの不足に対処すること。
- 記号的音楽の高品質で記述的なキャプションを提供することで、テキスト誘導音楽生成の研究を可能にすること。
- MIDIファイルの正確で自然な響きのキャプションを生成するスケーラブルで自動化されたフレームワークの開発。
- AI生成キャプションと人間が書いたキャプションを比較する包括的な聴取実験を通じて、キャプション品質の妥当性を検証すること。
- 将来的な音楽理解、音楽情報検索、音楽に応用されたマルチモーダルLLM分野の基盤を構築すること。
提案手法
- Lakh MIDIデータセットから168,407件のMIDIファイルを抽出し、対象コーパスとする。
- 最先端のMIRツールを用いて、テンポ、時間 signatures、コード進行、楽器の有無、ジャンル、ムードなどの音楽固有の特徴を自動抽出する。
- Claude-3 LLMを用いたコンテキスト内学習を活用し、少量のエキスパートアノテート例を用いたプロンプト工学フレームワークを設計し、抽出された特徴に基づいたキャプション生成を実現。
- 一貫性と記述の豊かさを向上させるために、500組の特徴-キャプションペアを活用し、LLMのコンテキスト内挙動をファインチューニング。
- 2段階の評価を実施:まず、23名の参加者(16名の一般聴取者、7名の音楽専門家)を対象に、7つの次元でキャプション品質を評価する聴取実験。
- 7段階リッカートスケールを用いて、全体の一致度、人間らしさ、ジャンル、ムード、トーン、コード、テンポの一致度を評価。

実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、少数のコンテキスト内例のみを用いて、MIDIファイルの高品質で記述的なキャプションを生成できるか?
- RQ2AI生成キャプションは、テンポ、コード進行、ジャンル、ムードといった重要な属性において、実際のMIDI音楽内容とどの程度一致するか?
- RQ3AI生成キャプションは、人間が書いたキャプションと比較して、認識された品質と音楽的正確性においてどの程度優れているか?
- RQ4自動化されたキャプション生成フレームワークは、スケールを考慮して自然で音楽的に整合性のある記述をどの程度生成できるか?
- RQ5完全な人間によるアノテーションなしで、合成キャプションパイプラインが人間水準の知覚的一致を達成できるか?
主な発見
- 一般聴取者による平均全体一致スコアはAI生成キャプションで5.63(7段階中)、人間が書いたキャプション(5.46)をわずかに上回った。
- 音楽専門家によるAI生成キャプションの全体一致スコアは4.92であり、人間が書いたキャプション(5.40)と比較的高い水準を維持した。
- 人間らしさの評価では、一般聴取者がAIキャプションを5.32と評価し、人間基準(5.21)に近く、音楽専門家は4.98(人間基準5.09)と評価した。
- テンポ一致度では、AIキャプションが人間が書いたキャプションを上回り、一般聴取者で5.86、専門家で5.77のスコアを記録した。
- コード一致度では、音楽専門家がAIキャプションを5.09と評価し、人間基準(5.74)をわずかに下回ったが、複雑なコード進行を要約する難易度を考慮すると、依然として強い一致を示した。
- 聴取実験により、キャプションがMIDIファイルと知覚的に一致しており、自然な響きであることが確認された。これにより、下流の音楽AI応用分野におけるフレームワークの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。