[论文解读] Evaluation and Improvement of Interpretability for Self-Explainable Part-Prototype Networks
本文提出了一项定量基准,用于评估部件原型网络中的可解释性,引入了两种新度量:一致性得分和稳定性得分。该研究提出了一种改进的ProtoPNet,包含浅层-深层特征对齐(SDFA)模块和得分聚合(SA)模块,在三个基准上实现了最先进的准确率与可解释性表现,显著提升了原型的一致性与鲁棒性。
Part-prototype networks (e.g., ProtoPNet, ProtoTree, and ProtoPool) have attracted broad research interest for their intrinsic interpretability and comparable accuracy to non-interpretable counterparts. However, recent works find that the interpretability from prototypes is fragile, due to the semantic gap between the similarities in the feature space and that in the input space. In this work, we strive to address this challenge by making the first attempt to quantitatively and objectively evaluate the interpretability of the part-prototype networks. Specifically, we propose two evaluation metrics, termed as consistency score and stability score, to evaluate the explanation consistency across images and the explanation robustness against perturbations, respectively, both of which are essential for explanations taken into practice. Furthermore, we propose an elaborated part-prototype network with a shallow-deep feature alignment (SDFA) module and a score aggregation (SA) module to improve the interpretability of prototypes. We conduct systematical evaluation experiments and provide substantial discussions to uncover the interpretability of existing part-prototype networks. Experiments on three benchmarks across nine architectures demonstrate that our model achieves significantly superior performance to the state of the art, in both the accuracy and interpretability. Our code is available at https://github.com/hqhQAQ/EvalProtoPNet.
研究动机与目标
- 为解决当前部件原型网络可解释性缺乏客观、定量评估的问题,这些问题目前依赖主观可视化或人工评估。
- 识别并量化两种核心可解释性缺陷:不一致性(原型在不同图像中映射到不同物体部件)与不稳定性(在小幅度输入扰动下,原型映射到不同部件)
- 通过数据集级别的物体部件标注,建立可复现的、客观的评估框架,以评估原型的可解释性。
- 通过架构创新提升原型的一致性与鲁棒性,从而改进部件原型网络的可解释性。
- 建立一个基准,用于评估并推动自解释模型的发展,超越定性可视化。
提出的方法
- 提出一致性得分度量,基于与真实部件标注的空间对齐,量化原型在不同图像中是否始终激活同一物体部件。
- 引入稳定性得分度量,通过对抗性或自然扰动,衡量原型在小幅度输入扰动下是否始终激活同一物体部件。
- 设计浅层-深层特征对齐(SDFA)模块,对齐浅层与深层特征图之间的空间相似性结构,保留深层特征中的空间信息。
- 开发得分聚合(SA)模块,将原型激活集中于其所属类别,减少其他类别之间的干扰。
- 将SDFA与SA模块应用于改进的ProtoPNet架构,提升特征表示与原型匹配的准确性。
- 采用余弦相似度与空间相似度匹配(通过公式10)计算浅层与深层特征之间的结构对齐,相似度度量定义为 $\mathrm{Sim}(t(z_{s}),t(z_{d}))=\frac{1}{\tilde{Z}}\sum\limits_{i=0}^{\tilde{Z}-1}e^{-\|t_{i}(z_{s})-t_{i}(z_{d})\|^{2}}$。

实验结果
研究问题
- RQ1现有部件原型网络在不同图像中,其原型与物体部件的映射关系在多大程度上保持一致?
- RQ2在语义解释层面,部件原型网络中的原型对小幅度输入扰动的鲁棒性如何?
- RQ3架构改进能否同时提升部件原型网络中基于原型的解释在一致性和稳定性方面的表现?
- RQ4所提出的评估度量(一致性得分与稳定性得分)与定性或人工可解释性评估相比有何差异?
- RQ5特征对齐与得分聚合对部件原型网络整体准确率与可解释性的影响如何?
主要发现
- 所提出的不一致性得分与稳定性得分度量成功量化了现有部件原型网络中的可解释性缺陷,揭示了原型在不同图像中常缺乏可靠的语义对应关系。
- SDFA模块显著提升了浅层与深层特征图之间的空间相似性对齐,使ResNet34在CUB-200-2011数据集上的相似度得分从12.4%提升至70.8%。
- SA模块将其他类别中相似原型的数量减少了最多5.6个点(从6.2降至11.8),表明减少了类别间干扰。
- 同时集成SDFA与SA模块的完整模型实现了最先进性能,在ResNet34上的不一致性得分提升了58.4%,在ResNet152上提升了51.5%。
- 可视化结果证实,所提模型中的原型在训练与测试图像中始终一致地激活同一物体部件(如头部),而基线模型则表现出混乱且不一致的关注区域。
- 该方法在三个基准(CUB-200-2011、Stanford Cars、PartImageNet)上优于现有部件原型网络,展现出更高的准确率与更强的可解释性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。