Skip to main content
QUICK REVIEW

[论文解读] Mood Classification Using Listening Data

Filip Korzeniowski, Oriol Nieto|arXiv (Cornell University)|Oct 11, 2020
Music and Audio Processing参考文献 39被引用 4
一句话总结

本文提出使用用户行为数据中的基于听音的嵌入向量来分类音乐情绪,实证表明其在包含67,000首歌曲的新型数据集上优于基于音频的嵌入向量,该数据集由AllMusic提供专家情绪标注。关键贡献在于证明了从隐式听音行为中提取的协同过滤信号,比音频特征更能有效捕捉与情绪相关的信息,即使在不同音频模型之间也成立。

ABSTRACT

The mood of a song is a highly relevant feature for exploration and recommendation in large collections of music. These collections tend to require automatic methods for predicting such moods. In this work, we show that listening-based features outperform content-based ones when classifying moods: embeddings obtained through matrix factorization of listening data appear to be more informative of a track mood than embeddings based on its audio content. To demonstrate this, we compile a subset of the Million Song Dataset, totalling 67k tracks, with expert annotations of 188 different moods collected from AllMusic. Our results on this novel dataset not only expose the limitations of current audio-based models, but also aim to foster further reproducible research on this timely topic

研究动机与目标

  • 构建一个大规模、由专家标注的音乐曲目与情绪关联数据集,以支持音乐情绪识别领域的可复现研究。
  • 探究基于听音的嵌入向量是否能在情绪分类任务中超越基于音频的模型。
  • 在共享的高质量情绪标注数据集上,评估基于音频和基于听音的嵌入向量的性能表现。
  • 分析标签频率与模型架构对情绪预测性能的影响。
  • 探索当前基于音频的模型在捕捉无法直接从音频信号中提取的情绪信息方面的局限性。

提出的方法

  • 通过将百万首歌曲数据集中Taste Profile子集的66,993首歌曲与AllMusic提供的专家情绪标注进行匹配,构建了AMS数据集。
  • 使用最先进的模型提取基于音频的嵌入向量,包括预训练和微调变体(如MCN-MSD-A、SCC-A)。
  • 通过同一数据集的隐式听音行为(如播放次数)进行矩阵分解,生成基于听音的嵌入向量。
  • 使用音频和听音嵌入向量作为输入特征,训练多标签分类模型。
  • 使用每标签的平均精确率评估模型性能,并分析不同标签频率下的表现。
  • 比较基于音频和基于听音的嵌入向量在标签层面性能的相关性,以评估其对共享信息的捕捉能力。

实验结果

研究问题

  • RQ1在大规模、由专家标注的数据集上,基于听音的嵌入向量是否能在音乐情绪分类中优于基于音频的嵌入向量?
  • RQ2情绪标签的频率如何影响基于音频和基于听音模型的性能表现?
  • RQ3不同基于音频的模型在多大程度上捕捉到相似的情绪相关信息?与基于听音的模型相比如何?
  • RQ4信号类型(隐式反馈与显式反馈)在情绪分类模型性能中起到何种作用?
  • RQ5是否存在固有上更难预测的情绪类别?这些类别是否与数据模态或模型类型相关?

主要发现

  • 在情绪分类任务中,基于听音的嵌入向量在所有情绪标签的平均精确率上均持续优于所有基于音频的模型。
  • 专有的听音模型(P-L)性能优于公开的TP-L模型,归因于其数据集规模大3,500倍,且显式反馈信号更强。
  • 基于音频的模型在标签层面的性能表现出高度相关性,表明它们学习到了相似但次优的情绪表征。
  • 基于听音的模型(TP-L和P-L)表现出较弱的相互相关性,表明其捕捉到了不同或更丰富的音乐情绪模式。
  • 标签频率对性能有中等程度的影响,但基于音频和基于听音的模型受影响程度相似,仅SCC-A模型受标签稀疏性影响更严重。
  • 结果表明,当前基于音频的模型未能提取出听音行为中蕴含的某些情绪相关信息,暗示情绪线索可能无法仅通过音频信号完全编码。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。