[论文解读] B-cos Networks: Alignment is All We Need for Interpretability
本文提出B-cos网络,一种通过在训练过程中强制权重-输入对齐,以增强深度神经网络可解释性的方法。该方法用一种新型的B-cos变换替代标准线性变换,使整个网络的计算可通过单一的线性总结实现,从而在保持ResNet、VGG和DenseNet等多种架构在ImageNet上具有竞争力性能的同时,生成高质量的视觉解释。
We present a new direction for increasing the interpretability of deep neural networks (DNNs) by promoting weight-input alignment during training. For this, we propose to replace the linear transforms in DNNs by our B-cos transform. As we show, a sequence (network) of such transforms induces a single linear transform that faithfully summarises the full model computations. Moreover, the B-cos transform introduces alignment pressure on the weights during optimisation. As a result, those induced linear transforms become highly interpretable and align with task-relevant features. Importantly, the B-cos transform is designed to be compatible with existing architectures and we show that it can easily be integrated into common models such as VGGs, ResNets, InceptionNets, and DenseNets, whilst maintaining similar performance on ImageNet. The resulting explanations are of high visual quality and perform well under quantitative metrics for interpretability. Code available at https://www.github.com/moboehle/B-cos.
研究动机与目标
- 为解决在不牺牲性能的前提下使深度神经网络本身具备可解释性这一挑战。
- 开发一种通过在训练过程中结构化约束权重更新,生成模型忠实且人类可解释的解释的方法。
- 通过单一统一的线性总结,实现对最终输出和中间神经元的高质量视觉解释。
- 确保与现有深度学习架构(如ResNet、VGG、InceptionNet和DenseNet)的兼容性。
- 证明通过结构设计而非事后解释方法,可实现可解释性与模型准确性的共存。
提出的方法
- B-cos变换通过归一化权重并应用与输入相关的缩放因子,替代标准线性层,促进学习权重与任务相关输入模式之间的对齐。
- 该变换确保任意B-cos层序列均可由单一线性变换W₁→L(x)总结,该变换能忠实反映给定输入下整个模型的计算过程。
- 通过使变换依赖于输入,在优化过程中引入对齐压力,促使权重与显著输入特征对齐。
- 通过基于反向传播的显著性图生成解释,利用所诱导的线性变换W₁→L(x),可视化每个输入像素对最终预测的贡献。
- B-cos变换被设计为全连接层和卷积层的即插即用替代品,仅需极少的架构修改。
- B-cos变换中的参数B可对权重-输入对齐程度进行细粒度控制,支持可解释性的调节。
实验结果
研究问题
- RQ1对线性层进行结构化修改是否能在不降低性能的前提下提升深度神经网络的可解释性?
- RQ2是否能通过单一的线性变换忠实且可解释地总结整个深度网络的计算过程?
- RQ3在训练过程中强制执行权重-输入对齐是否能产生更有意义且视觉上连贯的解释?
- RQ4B-cos变换是否能无缝集成到ResNet、VGG和DenseNet等多样化架构中,同时保持准确性?
- RQ5与事后解释技术相比,B-cos方法在忠实度和视觉质量方面表现如何?
主要发现
- B-cos网络在ImageNet上的top-1准确率与基线模型相当(相差1-2%以内),同时提供高度可解释且视觉连贯的解释。
- 所诱导的线性变换W₁→L(x)能忠实总结整个网络的计算过程,支持对最终输出和中间层神经元的解释。
- 在DenseNet-121第87层的单个神经元解释中,显示出高度特异性,神经元能可靠地突出显示面部、眼睛、车轮甚至水印等语义概念。
- 模型在预测中的不确定性具有视觉可解释性:差异图(Δ-解释)揭示了前两名预测类别之间的共享证据与对立证据。
- 由于归一化和缩放操作,B-cos变换使训练和推理时间增加最多达60%,但此开销预计可通过优化实现降低。
- 在所有测试的架构中,该方法在定量指标和定性分析方面均优于现有的事后解释技术。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。