Skip to main content
QUICK REVIEW

[论文解读] FMA: A Dataset For Music Analysis

Michaël Defferrard, Kirell Benzi|arXiv (Cornell University)|Dec 6, 2016
Music and Audio Processing参考文献 38被引用 161
一句话总结

介绍 Free Music Archive (FMA),一个大型 CC 许可的音频数据集,包含完整长度的高质量曲目、丰富的元数据,以及用于可重复 MIR 基准测试和端到端学习的预计算特征。它提供用于流派识别及相关任务的子集、拆分和基线。

ABSTRACT

We introduce the Free Music Archive (FMA), an open and easily accessible dataset suitable for evaluating several tasks in MIR, a field concerned with browsing, searching, and organizing large music collections. The community's growing interest in feature and end-to-end learning is however restrained by the limited availability of large audio datasets. The FMA aims to overcome this hurdle by providing 917 GiB and 343 days of Creative Commons-licensed audio from 106,574 tracks from 16,341 artists and 14,854 albums, arranged in a hierarchical taxonomy of 161 genres. It provides full-length and high-quality audio, pre-computed features, together with track- and user-level metadata, tags, and free-form text such as biographies. We here describe the dataset and how it was created, propose a train/validation/test split and three subsets, discuss some suitable MIR tasks, and evaluate some baselines for genre recognition. Code, data, and usage examples are available at https://github.com/mdeff/fma

研究动机与目标

  • 提供一个大型、公开许可的音乐数据集,以实现可重复的 MIR 基准测试并支持端到端学习研究。
  • 提供完整长度的高质量音频,具有按曲目、专辑和艺术家分层的丰富元数据,采用层级化的 161-genre 分类法。
  • 提出标准化的训练/验证/测试拆分和数据子集,以适应不同的资源水平。
  • 展示基线流派识别性能,以建立下限基准。

提出的方法

  • 汇集 106,574 条曲目,来自 16,341 位艺术家,跨 14,854 张专辑,均在 Creative Commons 许可下。
  • 构建一个具有多层次层级的 161-genre 分类法,并为每个曲目计算并存储 genres_all 与 genres_top。
  • 提供 518 个预计算音频特征,使用 librosa 0.5.0,在 2048 取样窗口、512 取样步长上,按七个统计量汇总。
  • 创建四个数据集子集(Full、Large、Medium、Small),具有定制属性以在真实度与可获取性之间取得平衡。
  • 定义一个 80/10/10 的分层拆分,含艺术家级别分离,以避免训练-测试数据泄漏并确保根分类的代表性。
  • 提供使用分类器(LR、kNN、SVM、MLP)在多种特征集上的流派识别基线。

实验结果

研究问题

  • RQ1大规模 CC-许可音乐数据集如何支持可重复的 MIR 研究和端到端学习?
  • RQ2哪些元数据丰富性和流派层级特征有助于提升音乐流派识别及相关任务?
  • RQ3哪些训练/验证/测试拆分和子集适合在真实度、可访问性与计算约束之间取得平衡?
  • RQ4使用 FMA 的预计算特征,在顶层流派识别任务上,常见分类器可以达到怎样的基线性能?

主要发现

  • 该数据集提供 106,574 条曲目,包含完整音频(44.1 kHz,约 320 kbps)和跨曲目、专辑、艺术家级的丰富元数据。
  • 实现了一个包含多个子流派的 161-genre 层级,以及 genres_all 注释,以支持细粒度的 MGR 任务。
  • 每条曲目预计算的 518 个 Librosa 特征可实现快速基线实验,且按窗口进行七个统计量汇总。
  • 在 Medium 子集上的基线流派识别在不同特征/分类器组合下显示出不同的准确度,说明任务难度并提供下限参考。
  • 作者发布代码、数据和可重复的工作流,以促进 MIR 基准测试的透明性和可重复性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。