Skip to main content
QUICK REVIEW

[论文解读] Robust and Stable Black Box Explanations

Himabindu Lakkaraju, Nino Arsov|arXiv (Cornell University)|Nov 12, 2020
Explainable Artificial Intelligence (XAI)参考文献 45被引用 5
一句话总结

本文提出 ROPE,一种新颖的对抗性训练框架,用于生成黑箱模型的鲁棒且稳定的后验解释。通过在输入和分布的对抗性扰动上优化极小化极大目标,ROPE 生成的解释在分布偏移和微小输入扰动下仍能保持高保真度,显著优于 LIME、SHAP 和 MUSE 在真实世界和合成数据集上的鲁棒性与稳定性。

ABSTRACT

As machine learning black boxes are increasingly being deployed in real-world applications, there has been a growing interest in developing post hoc explanations that summarize the behaviors of these black boxes. However, existing algorithms for generating such explanations have been shown to lack stability and robustness to distribution shifts. We propose a novel framework for generating robust and stable explanations of black box models based on adversarial training. Our framework optimizes a minimax objective that aims to construct the highest fidelity explanation with respect to the worst-case over a set of adversarial perturbations. We instantiate this algorithm for explanations in the form of linear models and decision sets by devising the required optimization procedures. To the best of our knowledge, this work makes the first attempt at generating post hoc explanations that are robust to a general class of adversarial perturbations that are of practical interest. Experimental evaluation with real-world and synthetic datasets demonstrates that our approach substantially improves robustness of explanations without sacrificing their fidelity on the original data distribution.

研究动机与目标

  • 解决现有黑箱模型后验解释方法在鲁棒性和稳定性方面的不足。
  • 开发一种框架,确保解释在分布偏移和微小输入扰动下仍保持忠实。
  • 通过生成可靠且可迁移的解释,提升医疗保健和刑事司法等高风险领域中的可解释性。
  • 形式化并实例化对一类通用实际分布偏移的鲁棒性,包括边缘协变量扰动。
  • 证明对解释进行对抗性训练可提升在分布偏移下的结构稳定性和保真度。

提出的方法

  • 提出一种极小化极大优化目标,在定义的扰动集中最大化最坏情况分布偏移下的解释保真度。
  • 定义一组实际的分布偏移,包括对单个协变量的扰动,以确保解释中保留边缘依赖关系。
  • 为两种解释类型(线性模型(逻辑回归)和决策集)设计专用优化过程,支持基于梯度的训练。
  • 利用对抗性训练生成对输入级扰动(对抗性鲁棒性)和分布级偏移(分布鲁棒性)均鲁棒的解释。
  • 通过加权保真度目标,将该框架应用于单个和基于子组的黑箱模型(例如多个逻辑回归或决策集)。
  • 对连续参数模型使用梯度下降,对决策集等离散结构使用定制化优化。

实验结果

研究问题

  • RQ1是否可以在不牺牲原始数据分布上保真度的前提下,使后验解释对分布偏移具有鲁棒性?
  • RQ2对解释进行对抗性训练在微小输入扰动下如何提升其稳定性?
  • RQ3能否通过统一框架为线性模型和决策集生成鲁棒解释?
  • RQ4与 LIME、SHAP 和 MUSE 相比,ROPE 生成的解释在分布偏移下结构相似性保持程度如何?
  • RQ5对边缘协变量扰动的鲁棒性是否能提升解释在检测虚假相关性方面的可靠性?

主要发现

  • 在 bailing 数据集上,使用单个逻辑回归黑箱时,ROPE logistic 和 ROPE logistic multi 的系数失配比 LIME 和 SHAP 低 38.2%。
  • 对于多个逻辑回归黑箱,ROPE logistic multi 相较基线至少降低了 38.05% 的系数失配。
  • 在 bailing 数据集上,ROPE dset multi 在解释单个或多个决策集时,规则匹配率分别比 MUSE 高 42.3% 和 60.4%。
  • ROPE dset multi 的特征匹配率也至少比基线高 37%,表明其与黑箱的结构对齐性更强。
  • 在输入扰动下评估时,ROPE 解释的结构相似性比基线高出 18.21% 至 21.08%,证明其具有更优的稳定性。
  • 该框架成功提升了对对抗性输入扰动和分布偏移的鲁棒性,且在原始数据分布上的保真度未下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。