[论文解读] Look at the Variance! Efficient Black-box Explanations with Sobol-based Sensitivity Analysis
本文提出了一种新颖的黑盒解释方法,利用Sobol敏感性分析高效估计特征重要性,同时捕捉高阶交互作用。通过结合准蒙特卡洛采样与扰动掩码,以及高效的Sobol指数估计器,该方法在视觉和自然语言处理基准上实现了最先进水平的忠实度表现——与或优于白盒方法——同时相比现有黑盒方法将计算时间减少了高达50%。
We describe a novel attribution method which is grounded in Sensitivity Analysis and uses Sobol indices. Beyond modeling the individual contributions of image regions, Sobol indices provide an efficient way to capture higher-order interactions between image regions and their contributions to a neural network's prediction through the lens of variance. We describe an approach that makes the computation of these indices efficient for high-dimensional problems by using perturbation masks coupled with efficient estimators to handle the high dimensionality of images. Importantly, we show that the proposed method leads to favorable scores on standard benchmarks for vision (and language models) while drastically reducing the computing time compared to other black-box methods -- even surpassing the accuracy of state-of-the-art white-box methods which require access to internal representations. Our code is freely available: https://github.com/fel-thomas/Sobol-Attribution-Method
研究动机与目标
- 开发一种通用、高效且忠实的黑盒解释方法,用于深度学习模型,无需访问内部网络状态。
- 解决现有黑盒方法的局限性,如计算成本高以及对高阶特征交互作用建模有限。
- 将敏感性分析技术——特别是Sobol指数——扩展至深度学习可解释性领域,以处理图像和文本等高维输入。
- 证明基于方差的归因方法即使在无内部模型访问的情况下,也能实现与最先进白盒方法相当或更优的性能。
- 在视觉与自然语言处理基准上验证该方法,展示其在真实场景中的鲁棒性与高效性。
提出的方法
- 该方法使用准蒙特卡洛(QMC)序列在输入特征(如图像像素或词语)上采样实值扰动掩码。
- 通过一种图像修复函数将扰动掩码应用于输入,以连续方式修改输入特征(如降低像素强度,或在自然语言处理中二值化词语的有无)。
- 收集每个扰动输入下模型的输出预测,并从这些输出中估计Sobol指数以量化特征重要性。
- 一阶Sobol指数($\mathcal{S}_i$)衡量单个特征的贡献,而总效应指数($\mathcal{S}_{T_i}$)则捕捉个体贡献与高阶交互作用的综合影响。
- 采用敏感性分析文献中的高效估计器,以减少所需的前向传播次数,使方法可扩展至高维输入。
- 在自然语言处理中,该方法通过二值化掩码来模拟词语移除,从而适用于文本分类任务。
实验结果
研究问题
- RQ1Sobol基敏感性分析能否被有效适配,以生成深度神经网络的忠实且高效的黑盒解释?
- RQ2通过总效应Sobol指数引入高阶特征交互作用,相较于一阶方法,是否能显著提升解释质量?
- RQ3该方法能否在视觉与自然语言处理基准上实现具有竞争力的性能,同时显著快于现有黑盒方法?
- RQ4尽管不需访问内部模型表示,该方法是否仍能超越或匹配白盒方法的忠实度?
- RQ5在图像与文本等不同模态中,扰动策略选择(连续 vs. 二值)如何影响性能?
主要发现
- 所提出的Sobol基方法在IMDB数据集上对bi-LSTM模型实现了0.461的词语删除得分,优于所有测试的基于梯度的白盒方法,整体排名第二。
- 对于BERT模型,该方法实现了0.598的删除得分,尽管默认掩码分布平均移除一半词语,但该得分仍具竞争力。
- 该方法相比其他黑盒方法将计算成本降低了高达50%,同时在图像与文本基准上保持或提升了忠实度。
- 在图像分类任务中,该方法与最先进黑盒方法表现相当或更优,甚至可与Integrated Gradients等白盒方法的准确率相媲美。
- 总效应Sobol指数($\mathcal{S}_{T_i}$)有效凸显了联合贡献——如眼睛与猞猁尖端之间的交互作用——展示了该方法对复杂非线性交互作用的建模能力。
- 该方法在不同模态间具有鲁棒性:通过将扰动函数调整为二值化词语有无,可从视觉任务泛化至自然语言处理任务,同时保持优异性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。