[论文解读] Two-level Explanations in Music Emotion Recognition
本文提出了一种用于音乐情感识别的两级可解释人工智能框架,将音频频谱图与可解释的中层感知特征(例如,演奏方式、紧张感)关联,并进一步关联到情感预测。通过结合线性情感头与基于LIME的音频到中层特征解释,该方法生成了在视觉和听觉上均可解释的解释,实现了可追溯的、有针对性的音频操作,从而实现情感控制。
Current ML models for music emotion recognition, while generally working quite well, do not give meaningful or intuitive explanations for their predictions. In this work, we propose a 2-step procedure to arrive at spectrogram-level explanations that connect certain aspects of the audio to interpretable mid-level perceptual features, and these to the actual emotion prediction. That makes it possible to focus on specific musical reasons for a prediction (in terms of perceptual features), and to trace these back to patterns in the audio that can be interpreted visually and acoustically.
研究动机与目标
- 解决深度学习模型在音乐情感识别中可解释性不足的问题。
- 通过中层感知表征弥合抽象情感预测与具体音频特征之间的鸿沟。
- 通过将音频频谱图与中层特征关联,生成稳定、视觉可解释且声学上有意义的解释。
- 通过识别对情感预测贡献最大的频谱图区域,实现有针对性的音频修改。
- 提升模型透明度,以支持需要可控情感表达的音乐应用。
提出的方法
- 采用VGG风格的卷积神经网络,共享中间层用于预测7种中层感知特征,最终线性层用于预测8种情感特质。
- 通过联合损失函数进行联合训练,同时优化中层特征预测与情感预测。
- 在音频到中层特征之间应用基于LIME的解释方法,利用扰动的频谱图样本识别显著的图像区域。
- 使用Felzenszwalb的分割算法,参数设置为scale=25和min_size=40,以实现最优的频谱图分割。
- 通过p值与权重比阈值(10^-6)进行自动特征选择,以稳定并减少解释的复杂度。
- 基于加权的频谱图片段进行音频重合成,生成突出影响特征的“增强”版本,以供聆听。
实验结果
研究问题
- RQ1通过引入中层感知特征,两级模型是否能提升音乐情感识别中的可解释性?
- RQ2如何将LIME方法适配以在频谱图级别生成稳定、视觉可解释的解释,用于音频到中层特征的预测?
- RQ3所识别的频谱图区域在多大程度上对应于具有感知意义的音乐特质,如演奏方式或节奏复杂度?
- RQ4这些解释是否能够支持有针对性的音频修改,从而以可控方式改变感知到的情感特质?
- RQ5采样扰动的数量在多大程度上影响基于频谱图的LIME解释的稳定性和质量?
主要发现
- 两级模型在情感预测性能上与不可解释的基线模型相当,证实可解释性不会损害准确性。
- 基于LIME的解释成功识别出特定频谱图区域——尤其在鼓音丰富的段落中——这些区域对“演奏方式”和“能量”等预测有贡献。
- 使用50,000个扰动样本显著提高了解释的稳定性,相比默认LIME设置效果更优。
- 在10^-6的p值与权重比阈值下进行自动p值与权重比阈值筛选,有效选择了每实例30至60个相关频谱图片段,减少了噪声并提升了可解释性。
- 基于正权重片段重合成的音频清晰突出了打击乐器元素的影响,证实了解释的声学有效性。
- 该方法可生成“增强”音频版本,使特定音乐特征更加明显,支持在情感导向音频编辑中的潜在应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。