[论文解读] Symbolic Music Data Version 1.0
本文介绍了符号音乐数据集 V1.0,这是一个包含 19,700 个经过清洗和预处理的 MIDI 文件的新数据集,数据源自 Classical Archives,通过以 tick 为单位的音符开始/结束时间表示符号音乐。作者采用概率过滤模型排除低质量文件,基于签名向量对文件进行层次聚类以划分训练/验证/测试集,并提供一种改进的表示方法,相比传统的钢琴卷帘格式更准确地捕捉音符时值和多声部结构。
In this document, we introduce a new dataset designed for training machine learning models of symbolic music data. Five datasets are provided, one of which is from a newly collected corpus of 20K midi files. We describe our preprocessing and cleaning pipeline, which includes the exclusion of a number of files based on scores from a previously developed probabilistic machine learning model. We also define training, testing and validation splits for the new dataset, based on a clustering scheme which we also describe. Some simple histograms are included.
研究动机与目标
- 创建一个高质量、大规模的符号音乐数据集,用于训练机器学习模型。
- 通过建模显式的音符起始和终止时间而非传统的二值开启/关闭状态,解决钢琴卷帘表示方法的局限性。
- 通过基于音乐内容对文件进行聚类,减少在训练/验证/测试集划分中因重复曲目导致的数据泄露和统计依赖。
- 通过使用学习到的概率模型过滤低质量或损坏的 MIDI 文件,提升数据质量。
- 通过保留精确的音符时间边界,实现对多声部音乐和表现性节拍的更准确建模。
提出的方法
- 该数据集源自从 Classical Archives 收集的 20,006 个 MIDI 文件,其中 306 个通过启发式过滤评分被排除。
- 过滤评分计算为预训练模型下负对数似然的均值加上标准误,用于识别低质量文件。
- 音符事件经过处理以解决 sustain 踩弦踏板效应,并移除同一通道上重叠或重复的音符。
- 移除打击乐音轨以及音符少于两个的通道,以确保与旋律性乐器建模的一致性。
- 时间分辨率重采样为每四分音符 2400 个 tick,这是所有源数据集中的通用分辨率,以统一时间表示。
- 每个文件的签名向量由音符音高类别的归一化直方图和量化后的音符时值生成,用于层次聚类以形成数据集划分。
实验结果
研究问题
- RQ1如何构建一个大规模符号音乐数据集,其时间保真度相比钢琴卷帘表示方法有显著提升?
- RQ2在无法访问原始文件的情况下,如何在大型档案中有效过滤低质量或损坏的 MIDI 文件?
- RQ3当同一首乐曲存在多个版本时,如何设计数据划分以最小化统计依赖?
- RQ4与现有格式相比,新表示方法在多大程度上保留了表现性节拍和多声部结构?
- RQ5在新、大规模语料库中,能否通过在现有数据集上训练的概率模型有效识别并排除低质量文件?
主要发现
- 作者成功从原始的 20,006 个 MIDI 文件中筛选出 19,700 个高质量文件,基于学习到的过滤评分排除了 306 个文件。
- 基于负对数似然和标准误的过滤方法经过听音测试验证,能有效识别低质量文件。
- 基于层次聚类的划分策略生成了内容相似、连续的训练、验证和测试集,显著减少了数据泄露。
- CMA 数据集包含最多达 46 个声部的乐曲,体现了复杂的多声部音乐,如拉威尔的《高贵与感伤的圆舞曲》和霍尔斯特的《地球》。
- 新表示方法比钢琴卷帘格式更准确地捕捉音符时值和多声部特性,从而支持对表现性演奏的更好建模。
- 数据集以每四分音符 2400 个 tick 的标准化分辨率发布,确保模型间的兼容性并减少量化误差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。