[论文解读] Generating Interpretable Counterfactual Explanations By Implicit Minimisation of Epistemic and Aleatoric Uncertainties
本文提出了一种白盒方法,通过隐式最小化分类器中的认知不确定性和随机不确定性,生成可解释的反事实解释(CEs),而无需依赖辅助生成模型。该方法提升了CE的真实性和明确性,在MNIST和表格数据集上实现了最先进的IM1得分,同时保持了具有竞争力的扰动最小化效果。
Counterfactual explanations (CEs) are a practical tool for demonstrating why machine learning classifiers make particular decisions. For CEs to be useful, it is important that they are easy for users to interpret. Existing methods for generating interpretable CEs rely on auxiliary generative models, which may not be suitable for complex datasets, and incur engineering overhead. We introduce a simple and fast method for generating interpretable CEs in a white-box setting without an auxiliary model, by using the predictive uncertainty of the classifier. Our experiments show that our proposed algorithm generates more interpretable CEs, according to IM1 scores, than existing methods. Additionally, our approach allows us to estimate the uncertainty of a CE, which may be important in safety-critical applications, such as those in the medical domain.
研究动机与目标
- 为解决生成既真实又明确的反事实解释的挑战,避免依赖复杂的辅助生成模型。
- 通过认知不确定性(知识缺乏)和随机不确定性(固有数据噪声)的视角,定义并实现反事实解释中的可解释性。
- 开发一种方法,利用分类器中已有的不确定性估计(如蒙特卡洛丢弃模型中所含),在最小工程开销下生成高质量的CEs。
- 通过实证验证,基于不确定性的最小化方法相较于现有方法能显著提升CE的可解释性,尤其在真实性和清晰度方面。
提出的方法
- 该方法使用带有蒙特卡洛丢弃的分类器来估计认知不确定性和随机不确定性,将低不确定性视为真实性和明确性的代理指标。
- 其损失函数在反事实生成过程中隐式最小化两类不确定性,偏好那些在数据分布下可能且分类结果明确的输入。
- 该算法通过梯度引导的逐像素迭代扰动,寻找能改变预测结果且同时降低不确定性的最小扰动。
- 它不需要独立的生成模型,而是依赖于基础分类器的预测不确定性,从而降低复杂度和训练开销。
- 该方法在白盒设置下应用,可直接访问模型的梯度和不确定性估计。
- 通过IM1得分评估可解释性,通过L1距离评估扰动最小化,并对集成模型规模和对抗训练进行了消融研究。
实验结果
研究问题
- RQ1认知不确定性能否作为反事实解释中真实性的代理?
- RQ2随机不确定性是否能通过识别边界或不确定的预测来减少反事实的模糊性?
- RQ3在不使用辅助模型的情况下,隐式最小化两类不确定性是否能产生比现有方法更具可解释性的CEs?
- RQ4与基于对抗攻击和生成模型的基线方法相比,该方法在真实性和最小化方面表现如何?
主要发现
- 在MNIST数据集上,所提方法IM1得分为0.98,显著优于JSMA(1.11)和VLK(1.12),证明了其优越的真实性。
- 在乳腺癌诊断数据集上,该方法IM1得分为0.89,而VLK为2.81,JSMA为1.06,表明其在表格数据上表现强劲。
- 在波士顿房价数据集上,该方法IM1得分为0.85,优于VLK(2.55)和JSMA(1.50),证实了其在可解释性方面的一致性提升。
- 尽管其L1扰动幅度大于JSMA(如MNIST上为38.3 vs. 14.4),但生成的CE更真实且更具可解释性,验证了最小化与可解释性之间的权衡。
- 消融研究显示,IM1得分随集成模型数量增加至10个模型时持续提升,之后趋于饱和,表明收益递减。
- 对抗训练提升了IM1得分,但导致解释的稀疏性降低,表明鲁棒性与扰动稀疏性之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。