[论文解读] Sanity checks and improvements for patch visualisation in prototype-based image classification
本文揭示了原型模型(如ProtoPNet和ProtoTree)所采用的图像块可视化方法中的关键缺陷,表明这些方法常将注意力错误地定位到无关图像区域。通过使用SmoothGrad和PRP等显著性方法,作者展示了更忠实的归因方式,减少了虚假偏差,并提升了在细粒度数据集(如CUB-200-2011和Stanford Cars)上的解释可靠性。
In this work, we perform an in-depth analysis of the visualisation methods implemented in two popular self-explaining models for visual classification based on prototypes - ProtoPNet and ProtoTree. Using two fine-grained datasets (CUB-200-2011 and Stanford Cars), we first show that such methods do not correctly identify the regions of interest inside of the images, and therefore do not reflect the model behaviour. Secondly, using a deletion metric, we demonstrate quantitatively that saliency methods such as Smoothgrads or PRP provide more faithful image patches. We also propose a new relevance metric based on the segmentation of the object provided in some datasets (e.g. CUB-200-2011) and show that the imprecise patch visualisations generated by ProtoPNet and ProtoTree can create a false sense of bias that can be mitigated by the use of more faithful methods. Finally, we discuss the implications of our findings for other prototype-based models sharing the same visualisation method.
研究动机与目标
- 调查ProtoPNet和ProtoTree等原型基图像分类模型中图像块可视化的可靠性。
- 评估当前可视化方法是否能准确反映模型的注意力机制与决策过程。
- 提出并验证一种基于目标级分割标注的更忠实的相关性度量方法。
- 评估主干网络架构(如VGG19与ResNet50)对原型忠实度与偏差的影响。
- 阐明此类可视化技术在自解释模型中广泛应用的更广泛影响。
提出的方法
- 作者使用两个细粒度数据集——CUB-200-2011和Stanford Cars——来评估可视化保真度。
- 将标准的上采样可视化方法与显著性方法(如SmoothGrad和PRP,即剪枝相关性传播)进行比较。
- 提出一种新颖的相关性度量方法,利用真实目标分割掩码来评估原型和测试图像块是否聚焦于正确的物体区域。
- 应用删除度量方法,定量评估当关键图像区域被移除时模型置信度的下降程度,以衡量解释的忠实度。
- 评估多种主干网络架构(如VGG19和ResNet50)对原型相关性与可视化质量的影响。
- 将分析扩展至共享相同可视化流程的其他模型,如ProtoPShare、ProtoPool、可变形ProtoPNet和TesNet。
实验结果
研究问题
- RQ1ProtoPNet和ProtoTree中的标准图像块可视化方法是否能准确地在测试图像和原型中定位感兴趣区域?
- RQ2与上采样方法相比,基于显著性的方法(如SmoothGrad和PRP)在多大程度上更忠实于模型的实际决策过程?
- RQ3使用目标级分割掩码在多大程度上能改善原型相关性的评估,并减少解释中的虚假偏差?
- RQ4主干网络架构的选择(如VGG19与ResNet50)在多大程度上影响图像块可视化结果的忠实度与可靠性?
- RQ5在ProtoPNet和ProtoTree中观察到的问题是否可推广至其他使用相同可视化流程的原型基模型?
主要发现
- ProtoPNet和ProtoTree中基于上采样的标准可视化方法经常错误地将注意力定位到背景区域,造成模型存在偏差的错觉。
- 显著性方法(如SmoothGrad和PRP)能产生显著更忠实的图像块,降低误定位的可能性。
- 在使用所提出的基于分割的相关性度量时,上采样方法与实际感兴趣物体区域的对齐性较差,而PRP和SmoothGrad则表现出更强的相关性。
- 删除度量结果证实,当关键图像区域被移除时,PRP和SmoothGrad能保留更多的预测相关性,表明其具有更高的忠实度。
- 研究发现,基于VGG19的模型比基于ResNet50的模型表现出更高比例的有偏原型和测试图像块,表明对主干网络选择具有敏感性。
- 研究结果表明,可视化方法本身(而非模型架构)可能引入误导性解释,从而削弱对自解释模型的信任。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。