[论文解读] Fine-Grained Neural Network Explanation by Identifying Input Features with Predictive Information
本文提出 InputIBA,一种通过输入域瓶颈保留与输出互信息的新型方法,以识别具有预测信息的输入特征,从而实现细粒度神经网络解释。与依赖潜在特征近似的现有方法不同,InputIBA 直接利用深度特征作为引导,计算输入级别的预测信息,实现与网络架构无关、高分辨率的归因,其在定位和特征重要性评估方面优于现有方法。
One principal approach for illuminating a black-box neural network is feature attribution, i.e. identifying the importance of input features for the network's prediction. The predictive information of features is recently proposed as a proxy for the measure of their importance. So far, the predictive information is only identified for latent features by placing an information bottleneck within the network. We propose a method to identify features with predictive information in the input domain. The method results in fine-grained identification of input features' information and is agnostic to network architecture. The core idea of our method is leveraging a bottleneck on the input that only lets input features associated with predictive latent features pass through. We compare our method with several feature attribution methods using mainstream feature attribution evaluation experiments. The code is publicly available.
研究动机与目标
- 解决现有特征归因方法在准确识别对神经网络预测有贡献的输入特征方面的局限性。
- 克服 IBA 等方法中依赖从潜在特征插值和平均带来的粗粒度与近似性问题。
- 开发一种直接在输入域测量预测信息的方法,实现全分辨率且无需架构假设。
- 提供一种理论基础扎实的细粒度解释方法,在定位和特征重要性评估方面优于现有基线方法。
提出的方法
- 该方法引入一个输入瓶颈,选择性地传递与预测性潜在特征相关联的特征,利用生成模型建立输入表示与潜在表示之间的对应关系。
- 通过优化变分目标,在输入上构建瓶颈,以最大化输入瓶颈与网络输出之间的互信息。
- 通过可微分的掩码估计过程学习输入瓶颈,其中掩码以深度特征为条件,并被训练以保留预测信息。
- 该方法采用与 IBA 相同的信息论原理,但将瓶颈从潜在空间转移到输入空间,从而实现输入级别互信息的直接计算。
- 利用深度生成模型在输入上推断一个瓶颈变量,使其诱导出与潜在空间瓶颈相同的潜在特征分布。
- 最终的归因分数来自学习到的输入掩码,以全空间和通道级分辨率表示每个输入特征的预测信息。
实验结果
研究问题
- RQ1是否可以不依赖潜在特征插值的近似,直接在输入域中识别预测信息?
- RQ2由深度特征引导的输入级瓶颈与潜在级瓶颈相比,在归因准确性和分辨率方面表现如何?
- RQ3InputIBA 在视觉和自然语言处理任务中,对相关输入特征的定位能力相比现有归因方法提升了多少?
- RQ4该方法是否在不依赖架构假设的前提下,对不同网络架构保持性能?
- RQ5在 ROAR、Sensitivity-N 和 Insertion-Deletion 等标准评估基准下,该方法表现如何?
主要发现
- 在 ImageNet 分类任务中,InputIBA 在边界框定位任务上的有效热比(EHR)达到 0.476 ± 0.007,显著优于 IBA(0.356 ± 0.005)和其他基线方法。
- 在 ROAR 评估中,InputIBA 正确识别了重要特征,而 DeepSHAP 和 Integrated Gradients 未能做到,表明其在特征重要性检测方面具有优势。
- 尽管基于信息论而非反向传播或扰动启发式方法,InputIBA 在定位性能上与 Guided Backpropagation 和 Extremal Perturbations 相当。
- 该方法在视觉(ImageNet)和自然语言处理(IMDB)任务中均表现出稳健性,证实其在卷积架构之外也具有良好的泛化能力。
- InputIBA 在基于敏感性的评估中表现优异,包括 Sensitivity-N 和 Insertion-Deletion,证实其在测量特征贡献方面的可靠性。
- 该方法在参数随机化下表现稳定,表明其并非模型权重或训练动态的偶然产物。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。