[论文解读] Fooling LIME and SHAP: Adversarial Attacks on Post hoc Explanation Methods
本论文表明基于扰动的事后解释,如 LIME 和 SHAP,可能被对抗性地搭建的分类器所愚弄,这些分类器在真实数据上表现偏向但在扰动数据上看起来不偏,实质上隐瞒了歧视。
As machine learning black boxes are increasingly being deployed in domains such as healthcare and criminal justice, there is growing emphasis on building tools and techniques for explaining these black boxes in an interpretable manner. Such explanations are being leveraged by domain experts to diagnose systematic errors and underlying biases of black boxes. In this paper, we demonstrate that post hoc explanations techniques that rely on input perturbations, such as LIME and SHAP, are not reliable. Specifically, we propose a novel scaffolding technique that effectively hides the biases of any given classifier by allowing an adversarial entity to craft an arbitrary desired explanation. Our approach can be used to scaffold any biased classifier in such a way that its predictions on the input data distribution still remain biased, but the post hoc explanations of the scaffolded classifier look innocuous. Using extensive evaluation with multiple real-world datasets (including COMPAS), we demonstrate how extremely biased (racist) classifiers crafted by our framework can easily fool popular explanation techniques such as LIME and SHAP into generating innocuous explanations which do not reflect the underlying biases.
研究动机与目标
- 为检测在高风险领域使用的黑盒模型的偏见而对事后解释(LIME 和 SHAP)的可靠性进行动机阐述与评估。
- 引入一个框架,用于构建对抗性分类器(支架),在真实数据分布下保留偏见,同时在扰动输入下看起来不偏。
- 在实际数据集(COMPAS、社区与犯罪、德国信贷)上评估该框架,展示解释可以被愚弄。
- 分析对扰动方案和解释中使用的背景分布对攻击鲁棒性的影响。
提出的方法
- 描述 LIME 和 SHAP 如何作为局部、基于扰动的解释工作。
- 提出一个框架,构建一个对抗性分类器 e,使其在真实数据分布 X_dist 上与 f 相匹配,但在扰动/分布外点使用不偏的 ψ。
- 训练一个 OOD 检测器 is_OOD,以使用由 X 及其扰动构建的带标签数据来引导支架来区分扰动点与分布内点。
- 用合成的不相关特征(以及可选的现有特征)来构造 ψ,以在保持对 X_dist 的偏见行为的同时控制解释。
- 证明 LIME/SHAP 使用的扰动可被利用,使得种族/性别在解释中看起来不重要,而预测仍然有偏。
- 在 COMPAS、社区与犯罪、德国信贷数据集上对攻击在 LIME 和 SHAP 的表现进行评估,报告特征重要性排名的变化。
实验结果
研究问题
- RQ1事后解释(LIME 和 SHAP)是否可能被操纵以隐藏黑盒模型中的潜在歧视性偏见?
- RQ2攻击者如何利用基于扰动的解释,以产生在扰动数据上看似无害但在真实数据上忠实于偏见行为的解释?
- RQ3在不同数据集和解释方法上,此类攻击的有效性和鲁棒性如何?
主要发现
- 对抗性分类器可以使 LIME 解释将重要特征从敏感属性移开,转而与真实数据高度相关的未相关特征,在 COMPAS 和社区与犯罪数据集上,以及在德国信贷数据集的 Loan%Income 上也如此。
- SHAP 解释也可被愚弄,大量数据点在顶层赋值中失去敏感特征,但 SHAP 的局部准确性在多个特征竞争时可能分散 attribution。
- LIME 比 SHAP 更易受攻击;SHAP 需要更准确的 OOD 检测器才能完全隐藏偏见,但在合理的 OOD 准确度下也可能被愚弄。
- 该攻击在扰动数据上使解释看起来无害,同时在分布内数据上保持原始分类器的预测。
- 对 f 的保真度 e 对 f 在所有数据集上为 100%;SHAP 的保真度在 75-91% 之间,视数据集而定,表明强但依赖数据集的成功。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。