[论文解读] XAI-based Comparison of Input Representations for Audio Event Classification
本文通过使用解释性人工智能(XAI)方法,结合离散傅里叶变换层 relevancy 分布传播(DFT-LRP),比较了基于一维卷积神经网络(1D-CNN,处理原始波形)与 YAMNet(处理时频谱图)模型在音频事件分类中的分类策略。研究发现,1D-CNN 学习到的特征更具可分性与类别特异性,且对音高和频谱变化的鲁棒性优于 YAMNet,后者更依赖于音高信息。
Deep neural networks are a promising tool for Audio Event Classification. In contrast to other data like natural images, there are many sensible and non-obvious representations for audio data, which could serve as input to these models. Due to their black-box nature, the effect of different input representations has so far mostly been investigated by measuring classification performance. In this work, we leverage eXplainable AI (XAI), to understand the underlying classification strategies of models trained on different input representations. Specifically, we compare two model architectures with regard to relevant input features used for Audio Event Detection: one directly processes the signal as the raw waveform, and the other takes in its time-frequency spectrogram representation. We show how relevance heatmaps obtained via "Siren"{Layer-wise Relevance Propagation} uncover representation-dependent decision strategies. With these insights, we can make a well-informed decision about the best input representation in terms of robustness and representativity and confirm that the model's classification strategies align with human requirements.
研究动机与目标
- 研究不同输入表示(原始波形 vs. 谱图)如何影响音频事件分类中的模型决策过程。
- 评估模型的分类策略是否与人类对音频事件的感知理解一致。
- 比较模型在滤波和音高偏移等音频信号扰动下的鲁棒性。
- 利用 XAI 技术揭示并对比不同输入表示下的底层决策机制。
- 通过识别能产生更可解释且更鲁棒的分类策略的输入表示,为未来模型设计提供指导。
提出的方法
- 采用两种 CNN 架构:一种处理原始波形(1DCNN),另一种使用时频谱图(YAMNet)。
- 应用 DFT-LRP 将模型输出的相关性反向传播至输入特征,实现人类可解释的时频域分析。
- 生成相关性热力图,量化每个时频成分对分类决策的重要性。
- 通过计算相关性图在类内与类间的一致性(余弦相似度),评估特征的可分性。
- 通过在测试样本上施加高通、低通及音高偏移增强,评估模型鲁棒性。
- 使用相关性质心可视化方法,比较不同声音类别间的平均相关性模式。
实验结果
研究问题
- RQ1在特征相关性方面,基于原始波形与基于谱图训练的模型,其分类策略有何差异?
- RQ2模型的决策过程是否与人类对音频事件的感知理解一致?
- RQ3哪种输入表示在面对滤波和音高偏移等音频信号扰动时,能带来更鲁棒的分类性能?
- RQ4相关性热力图在多大程度上揭示了模型中的类别特异性、可分性特征?
- RQ5DFT-LRP 的使用如何实现对不同输入表示下模型行为的有意义对比?
主要发现
- 1DCNN 模型在类内与类间相关性相似度上的差异显著更大(0.207 vs. 0.076),表明其学习到的特征更具可分性与类别特异性。
- YAMNet 展现出较高的类内与类间相似度(0.593 与 0.584),表明其特征学习的判别性较弱。
- 1DCNN 在高通滤波(3000 Hz)下仅损失 4.41% 的准确率,而 YAMNet 损失 18.19%,表明 1DCNN 更具鲁棒性。
- 在 'Siren' 类上进行 ±7 个半音的音高偏移时,1DCNN 损失 9.67% 准确率,而 YAMNet 损失 25.00%,表明 YAMNet 更依赖音高信息。
- 相关性热力图显示,YAMNet 的决策更受音高内容影响,而 1DCNN 依赖更广泛、更鲁棒的时序特征。
- XAI 分析证实,1DCNN 的分类策略更符合人类感知,且更不易受虚假相关性的干扰。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。