[论文解读] B-cos Alignment for Inherently Interpretable CNNs and Vision Transformers
本文提出了 B-cos 变换,这是一种可直接替换 CNN 和视觉 Transformer 中线性层的方法,能够在训练过程中促进权重与输入的对齐,从而实现模型的内在可解释性。该方法通过单一的线性变换总结整个网络的计算,实现忠实且人类可理解的解释,同时在保持 ImageNet 的 top-1 准确率超过 80% 的前提下,达到最先进的解释质量。
We present a new direction for increasing the interpretability of deep neural networks (DNNs) by promoting weight-input alignment during training. For this, we propose to replace the linear transformations in DNNs by our novel B-cos transformation. As we show, a sequence (network) of such transformations induces a single linear transformation that faithfully summarises the full model computations. Moreover, the B-cos transformation is designed such that the weights align with relevant signals during optimisation. As a result, those induced linear transformations become highly interpretable and highlight task-relevant features. Importantly, the B-cos transformation is designed to be compatible with existing architectures and we show that it can easily be integrated into virtually all of the latest state of the art models for computer vision - e.g. ResNets, DenseNets, ConvNext models, as well as Vision Transformers - by combining the B-cos-based explanations with normalisation and attention layers, all whilst maintaining similar accuracy on ImageNet. Finally, we show that the resulting explanations are of high visual quality and perform well under quantitative interpretability metrics.
研究动机与目标
- 解决深度神经网络在不依赖事后解释方法的前提下实现内在可解释性的挑战。
- 设计一种神经网络层,以在训练过程中促进网络权重与任务相关输入信号之间的对齐。
- 确保生成的模型解释既能忠实反映内部计算过程,又对人类具有视觉可解释性。
- 在显著提升卷积和注意力架构可解释性的同时,保持高模型准确率。
提出的方法
- 提出 B-cos 变换作为标准线性变换的新型替代方案,旨在优化过程中诱导输入相关的权重-输入对齐。
- B-cos 变换单元确保任意此类层的序列均可通过一个单一的线性变换进行总结,该变换能忠实反映给定输入下模型的内部计算。
- 该方法明确避免显式偏置项(b(x) = 0),以防止解释中出现虚假的边缘或角落伪影,从而提升可解释性。
- 通过修改优化目标,将 B-cos 层与批量归一化和注意力机制集成,以在保持训练稳定性的同时维持可解释性。
- 采用重新参数化的目标编码修改交叉熵损失,以鼓励模型利用对象特征来获取正类得分,减少对负偏置校正的依赖。
- 使用均值校正的 logits 和解释结果,以评估并提升模型输出的特异性和人类可解释性。
实验结果
研究问题
- RQ1是否可以设计一种改进的线性变换,使其在无需事后解释方法的前提下,天然生成可解释且忠实的解释?
- RQ2如何在训练过程中促进权重-输入对齐,以使模型表征更具可解释性?
- RQ3B-cos 变换在 ResNets、DenseNets、ConvNeXt 和视觉 Transformer 等现代架构中,能在多大程度上实现集成,同时保持准确率?
- RQ4与标准模型和现有解释方法相比,B-cos 层的使用是否能同时提升定性和定量的可解释性指标?
- RQ5是否可以通过重构优化目标,防止模型依赖虚假特征(如图像边缘)进行偏置计算,从而提升解释的清晰度?
主要发现
- B-cos 网络在 ImageNet 上的 top-1 准确率超过 80%,涵盖多种架构,包括 ResNets、DenseNets、ConvNeXt 和视觉 Transformer,与标准模型相比仅出现轻微性能下降。
- B-cos 解释在定性上表现更优,能清晰突出与任务相关的特征(如物体部件),在视觉质量和可解释性指标上均优于现有解释方法。
- 均值校正的解释(E’)显示,使用标准 BCE 损失训练的模型通常对所有类别都利用图像边缘作为正向偏置,而通过重新定义优化目标以聚焦于正向证据,可有效缓解该问题。
- 所提出的优化修改——重新定义目标编码——使得解释结果能清晰聚焦于目标物体,证实了模型设计与优化共同塑造了可解释性。
- B-cos 框架与归一化层和注意力机制兼容,可在不牺牲可解释性或性能的前提下应用于最先进模型。
- 即使仅使用 B-cos 层的 CNN(无非线性、归一化或正则化),在 CIFAR-10 上也表现出具有竞争力的性能,证明了 B-cos 变换本身具备强大的建模能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。