[论文解读] Multi-label Music Genre Classification from Audio, Text, and Images Using Deep Features
本文介绍 MuMu,一个用于多标签音乐流派分类的多模态数据集,并分析基于深度特征的模型在音频、文本和图像模态下的表现,结果显示模态融合带来收益。
Music genres allow to categorize musical items that share common characteristics. Although these categories are not mutually exclusive, most related research is traditionally focused on classifying tracks into a single class. Furthermore, these categories (e.g., Pop, Rock) tend to be too broad for certain applications. In this work we aim to expand this task by categorizing musical items into multiple and fine-grained labels, using three different data modalities: audio, text, and images. To this end we present MuMu, a new dataset of more than 31k albums classified into 250 genre classes. For every album we have collected the cover image, text reviews, and audio tracks. Additionally, we propose an approach for multi-label genre classification based on the combination of feature embeddings learned with state-of-the-art deep learning methodologies. Experiments show major differences between modalities, which not only introduce new baselines for multi-label genre classification, but also suggest that combining them yields improved results.
研究动机与目标
- 推动多标签、细粒度的音乐流派分类,超越粗粒化的单标签方案。
- 创建 MuMu,一个具有音频、文本和图像数据的大规模多模态数据集,覆盖 250 个流派,涉及 31k 张专辑。
- 为每种模态(音频、文本、图像)以及多模态融合开发和评估深度学习模型。
- 评估标签分解的收益以及多标签流派任务的多样化评估指标。
提出的方法
- 在 15 秒片段的 log-CQTs 上用 CNN 学习音轨表示,并训练音轨到专辑的聚合,随后再用一个浅层分类器。
- 通过 tf-idf 向量空间模型表示专辑文本,并使用 Babelfy 实体链接进行语义增强,将结果输入一个前馈网络。
- 使用在 ImageNet 上预训练并针对流派预测微调的 ResNet-101 提取封面图像特征,输出为 sigmoid。
- 研究两种标签嵌入方法:逻辑回归(二元交叉熵)和余弦(通过 PPMI、SVD 和低维嵌入进行标签分解)。
- 通过对各模态特征向量进行 L2 归一化后拼接,再训练一个多层感知机以预测多标签输出(logistic 或 cosine)。
- 使用 AUC(按标签平均)和 Catalog Coverage@k(k=1,3,5)来评估准确性和标签多样性。
实验结果
研究问题
- RQ1来自音频、文本和图像的基于深度学习的表示能否超越手工特征用于多标签流派分类?
- RQ2文本的语义增强和标签嵌入在多大程度上提升性能与多样性?
- RQ3音频、文本和图像特征的多模态融合是否优于单模态模型在 MuMu 流派上的表现?
- RQ4标签空间的降维如何影响准确性和目录覆盖率?
主要发现
- 基于深度学习的音频模型在性能上显著超越传统手工音频特征(例如 timbre-mlp 基线)。
- 基于文本的方法(尤其是带有语义增强的)在 AUC 上表现强劲,且目录覆盖率高于仅使用音频。
- 基于图像的分类落后于其他模态,但提供互补信息,可提升多模态性能。
- 多模态融合(A+T+I)结合 cosine 或 logistic 目标通常获得最佳的整体 AUC 和覆盖率,优于单一模态。
- 标签分解(cosine)在保持有竞争力的 AUC 的同时提高了目录覆盖率,与 logistic 在若干设置上相比。
- MuMu 数据集支持大规模的多标签、多模态流派研究,涵盖 31k 张专辑、147k 首曲目和 447k 条评论。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。