[论文解读] MidiCaps: A Large-Scale MIDI Dataset With Text Captions
本文介绍了 MidiCaps,这是首个大规模开放的 MIDI 文件数据集,包含 168,407 个 MIDI 文件及其类人化的文本描述。通过使用 Claude-3 大型语言模型进行上下文学习,基于提取的音乐特征(如节拍、和弦、流派和情绪)生成描述性文本,听觉研究验证了其高质量的对齐效果,从而支持文本到 MIDI 的生成以及跨模态音乐理解研究。
Generative models guided by text prompts are increasingly becoming more popular. However, no text-to-MIDI models currently exist due to the lack of a captioned MIDI dataset. This work aims to enable research that combines LLMs with symbolic music by presenting, the first openly available large-scale MIDI dataset with text captions. MIDI (Musical Instrument Digital Interface) files are widely used for encoding musical information and can capture the nuances of musical composition. They are widely used by music producers, composers, musicologists, and performers alike. Inspired by recent advancements in captioning techniques, we present a curated dataset of over 168k MIDI files with textual descriptions. Each MIDI caption describes the musical content, including tempo, chord progression, time signature, instruments, genre, and mood, thus facilitating multi-modal exploration and analysis. The dataset encompasses various genres, styles, and complexities, offering a rich data source for training and evaluating models for tasks such as music information retrieval, music understanding, and cross-modal translation. We provide detailed statistics about the dataset and have assessed the quality of the captions in an extensive listening study. We anticipate that this resource will stimulate further research at the intersection of music and natural language processing, fostering advancements in both fields.
研究动机与目标
- 为训练文本到 MIDI 模型解决大规模、开放、带标注的 MIDI 数据集缺乏的问题。
- 通过提供高质量、描述性的文本标注,支持基于文本引导的音乐生成研究。
- 开发一种可扩展的自动化框架,用于为 MIDI 文件生成准确且自然的描述。
- 通过全面的听觉研究,对比 AI 生成与人工书写的描述,验证描述质量。
- 为未来在音乐理解、音乐信息检索以及应用于音乐的多模态大语言模型方面的研究奠定基础。
提出的方法
- 从 Lakh MIDI 数据集提取 168,407 个 MIDI 文件作为源语料库。
- 使用最先进的音乐信息检索(MIR)工具,自动提取音乐特定特征,包括节拍、时间 signature、和弦进行、乐器存在性、流派和情绪。
- 设计一种提示工程框架,利用 Claude-3 大型语言模型进行上下文学习,基于提取的特征和少量专家标注示例生成描述。
- 使用精心筛选的 500 组特征-描述对,微调 LLM 的上下文行为,以确保一致性和描述的丰富性。
- 采用两阶段评估:首先,通过 23 名参与者(16 名普通听众,7 名音乐专家)的听觉研究,评估 7 个维度的描述质量。
- 使用 7 分制李克特量表评估描述质量,涵盖整体匹配度、类人度、流派、情绪、调性、和弦和节拍对齐。

实验结果
研究问题
- RQ1大型语言模型是否能仅依靠少量上下文示例,为 MIDI 文件生成高质量、描述性的文本?
- RQ2AI 生成的描述在节拍、和弦、流派和情绪等关键属性上,与 MIDI 文件的实际音乐内容对齐程度如何?
- RQ3在感知质量与音乐准确性方面,AI 生成的描述与人工书写的描述相比表现如何?
- RQ4自动化描述生成框架在大规模场景下,能否生成自然流畅且音乐上连贯的描述?
- RQ5在无需完整人工标注的情况下,合成描述生成流程是否能达到人类水平的感知对齐?
主要发现
- 普通听众对 AI 生成描述的整体匹配度平均得分为 5.63(满分 7),略高于人工书写的描述(5.46)。
- 音乐专家对 AI 生成描述的整体匹配度评分为 4.92,表现依然强劲,与人工书写的描述(5.40)相当。
- 在类人度方面,普通听众对 AI 描述的评分为 5.32,接近人工描述的 5.21;音乐专家评分为 4.98,接近人工基准的 5.09。
- 在节拍匹配方面,AI 生成描述得分分别为 5.86(普通听众)和 5.77(专家),优于人工描述。
- 在和弦匹配方面,音乐专家对 AI 描述的评分为 5.09,略低于人工基准(5.74),但仍表明其具有较强的对齐能力,尽管总结复杂和弦进行本身具有挑战性。
- 听觉研究证实,描述与 MIDI 文件在感知上高度对齐,且表达自然,支持该框架在下游音乐-AI 应用中的可行性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。