Skip to main content
QUICK REVIEW

[논문 리뷰] FMA: A Dataset For Music Analysis

Michaël Defferrard, Kirell Benzi|arXiv (Cornell University)|2016. 12. 06.
Music and Audio Processing참고 문헌 38인용 수 161
한 줄 요약

Free Music Archive (FMA)를 소개하는 대규모 CC-라이선스 오디오 데이터셋으로, 완전 길이의 고품질 트랙, 풍부한 메타데이터, 재현 가능한 MIR 벤치마킹 및 엔드-투-엔드 학습을 가능하게 하는 사전 계산된 특징을 제공합니다. 장르 인식 및 관련 작업을 위한 부분집합, 분할 및 기준선을 제공합니다.

ABSTRACT

We introduce the Free Music Archive (FMA), an open and easily accessible dataset suitable for evaluating several tasks in MIR, a field concerned with browsing, searching, and organizing large music collections. The community's growing interest in feature and end-to-end learning is however restrained by the limited availability of large audio datasets. The FMA aims to overcome this hurdle by providing 917 GiB and 343 days of Creative Commons-licensed audio from 106,574 tracks from 16,341 artists and 14,854 albums, arranged in a hierarchical taxonomy of 161 genres. It provides full-length and high-quality audio, pre-computed features, together with track- and user-level metadata, tags, and free-form text such as biographies. We here describe the dataset and how it was created, propose a train/validation/test split and three subsets, discuss some suitable MIR tasks, and evaluate some baselines for genre recognition. Code, data, and usage examples are available at https://github.com/mdeff/fma

연구 동기 및 목표

  • 재현 가능한 MIR 벤치마킹을 가능하게 하고 엔드투엔드 학습 연구를 지원하기 위해 대규모의 공개적으로 라이선스된 음악 데이터셋을 제공한다.
  • 트랙별, 앨범별, 아티스트별 풍부한 메타데이터를 포함한 전체 길이의 고품질 오디오를 계층적 161-장르 분류 체계로 제공한다.
  • 다양한 자원 수준에 맞춘 표준화된 train/validation/test 분할과 데이터 부분집합을 제안한다.
  • 하한 벤치마크를 설정하기 위한 기본 장르 인식 성능을 보여준다.

제안 방법

  • Creative Commons 하에 라이선스된 16,341명의 아티스트로부터 14,854장의 앨범에 걸쳐 106,574 트랙을 수집한다.
  • 다층 계층 구조를 갖춘 161-장르 분류 체계를 구성하고 각 트랙에 대해 genres_all 와 genres_top 을 계산하여 저장한다.
  • 7개의 통계치를 요약하여 2048-샘플 창과 512-샘플 홉에서 librosa 0.5.0을 사용해 518개의 사전 계산된 오디오 특징을 제공한다.
  • 현실성과 접근성을 균형있게 맞추기 위해 맞춤 설정된 네 가지 데이터셋 부분집합(Full, Large, Medium, Small)을 생성한다.
  • root 장르의 표현을 보장하고 train-test 누수를 피하기 위해 아티스트 수준 분리로 80/10/10의 층화된 분할을 정의한다.
  • 여러 특징 세트에 대해 분류기(LR, kNN, SVM, MLP)를 이용한 장르 인식의 기준선을 제공한다.

실험 결과

연구 질문

  • RQ1대규모 CC-라이선스 음악 데이터셋이 재현 가능한 MIR 연구와 엔드투엔드 학습을 어떻게 지원할 수 있는가?
  • RQ2메타데이터의 풍부함과 장르 계층 구조 특징이 음악 장르 인식 및 관련 작업을 어떻게 향상시키는가?
  • RQ3현실성, 접근성 및 계산 제약 간의 균형을 맞추기 위한 적합한 train/validation/test 분할과 부분집합은 무엇인가?
  • RQ4FMA에서 사전 계산된 특징을 사용한 최상위 장르 인식에서 일반적인 분류기가 달성하는 기본 성능은 무엇인가?

주요 결과

  • 데이터셋은 트랙 단위, 앨범 단위, 아티스트 단위에 걸친 풍부한 메타데이터와 함께 전체 오디오(44.1 kHz, 약 320 kbps)를 갖춘 106,574 트랙을 제공합니다.
  • 다수의 하위 장르와 genres_all 주석을 포함하는 161-장르 계층 구조가 구현되어 미세한 MGR 작업을 지원합니다.
  • 트랙당 사전 계산된 518개 Librosa 특징은 창(window)별 7개의 통계 요약으로 빠른 기준선 실험을 가능하게 한다.
  • Medium 하위집합에서의 기본 장르 인식은 특징/분류기 조합에 따라 다양한 정확도를 보여 주며 작업의 난이도를 설명하고 하한 참조를 제공합니다.
  • 저자는 MIR 벤치마킹의 투명성과 재현성을 증진하기 위해 코드/데이터 및 재현 가능한 워크플로를 공개합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.