Skip to main content
QUICK REVIEW

[论文解读] Tracing Back Music Emotion Predictions to Sound Sources and Intuitive Perceptual Qualities

Shreyan Chowdhury, Verena Praher|arXiv (Cornell University)|Jun 14, 2021
Music and Audio Processing参考文献 31被引用 6
一句话总结

本文提出了一种两级解释框架,通过音频LIME和中层感知特征,将音乐情感预测追溯至直观的感知属性和底层声源。通过将模型预测与可解释的音频组件关联,该方法实现了对有偏模型的调试,并揭示了使用平衡数据微调后预测性能的提升,展示了在音乐情感识别中模型可解释性和可靠性的增强。

ABSTRACT

Music emotion recognition is an important task in MIR (Music Information Retrieval) research. Owing to factors like the subjective nature of the task and the variation of emotional cues between musical genres, there are still significant challenges in developing reliable and generalizable models. One important step towards better models would be to understand what a model is actually learning from the data and how the prediction for a particular input is made. In previous work, we have shown how to derive explanations of model predictions in terms of spectrogram image segments that connect to the high-level emotion prediction via a layer of easily interpretable perceptual features. However, that scheme lacks intuitive musical comprehensibility at the spectrogram level. In the present work, we bridge this gap by merging audioLIME -- a source-separation based explainer -- with mid-level perceptual features, thus forming an intuitive connection chain between the input audio and the output emotion predictions. We demonstrate the usefulness of this method by applying it to debug a biased emotion prediction model.

研究动机与目标

  • 解决音乐情感识别模型中缺乏直观、具有音乐意义的解释问题。
  • 通过可解释的中层感知特征,弥合低层次音频特征与高层次情感预测之间的鸿沟。
  • 通过将错误预测追溯至特定声源和感知特征,实现对模型偏见的检测与调试。
  • 构建从原始音频到情感标签的分层解释链,经由中层感知特征和源分离组件。
  • 在有偏见的情感模型上验证该方法,展示解释如何预测并验证微调后的模型改进。

提出的方法

  • 整合基于声源分离的音频LIME解释器与中层感知特征,生成具有音乐意义的可解释性解释。
  • 采用两步解释流程:首先识别相关的中层感知特征,然后将这些特征回溯至输入音频中的特定声源。
  • 应用类似LIME的局部代理建模方法,在中层特征空间中通过分离声源的音频组件作为可解释特征来解释预测。
  • 使用声源分离模型(例如Spleeter)将音频分解为独立声源(例如人声、军鼓、低音)以支持解释。
  • 通过扰动声源贡献并观察模型预测的变化来构建解释,以识别关键影响组件。
  • 利用中层特征与情感预测之间的线性关联,实现可追溯性与可解释性。

实验结果

研究问题

  • RQ1如何以直观、具有感知意义的音频组件来解释音乐情感预测?
  • RQ2能否通过可解释的中层感知特征,构建一个分层解释框架,将高层次情感预测与低层次声源联系起来?
  • RQ3该方法在多大程度上能够揭示并调试音乐情感识别中的模型偏见?
  • RQ4训练数据分布的变化如何影响模型行为?该方法能否预测这些变化?
  • RQ5该方法能否通过可解释性为模型改进提供可操作的洞察?

主要发现

  • 该方法成功将有偏见情感模型中的错误预测追溯至特定的中层感知特征及其贡献声源,实现了对模型缺陷的诊断。
  • 解释结果表明,模型在罕见流派上表现不佳的原因是训练数据中缺乏该流派典型声源的充分暴露。
  • 该模型在罕见流派上的预测模式被追溯至单一中层感知特征,该特征与特定音频源(如军鼓或人声)相关联,证实了数据不平衡问题。
  • 在使用平衡数据集微调后,模型的预测与基于解释的预期保持一致,验证了该方法的预测能力。
  • 将音频LIME与中层特征结合,构建了从原始音频到情感标签的音乐可解释性解释链,增强了模型的信任度与可调试性。
  • 该方法能够对微调后模型行为变化进行定性验证,展示了其在模型开发与公平性评估中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。