[论文解读] Feature Attributions and Counterfactual Explanations Can Be Manipulated
本文表明,特征归因方法(如 LIME、SHAP)和反事实解释(如 Wachter 的算法、DiCE)可被攻击者操纵以隐藏模型偏差。通过使用专门设计的目标函数训练有偏见的模型,作者展示了即使底层模型系统性地歧视受保护群体,解释结果仍可呈现为公平且无偏见。
As machine learning models are increasingly used in critical decision-making settings (e.g., healthcare, finance), there has been a growing emphasis on developing methods to explain model predictions. Such extit{explanations} are used to understand and establish trust in models and are vital components in machine learning pipelines. Though explanations are a critical piece in these systems, there is little understanding about how they are vulnerable to manipulation by adversaries. In this paper, we discuss how two broad classes of explanations are vulnerable to manipulation. We demonstrate how adversaries can design biased models that manipulate model agnostic feature attribution methods (e.g., LIME \& SHAP) and counterfactual explanations that hill-climb during the counterfactual search (e.g., Wachter's Algorithm \& DiCE) into extit{concealing} the model's biases. These vulnerabilities allow an adversary to deploy a biased model, yet explanations will not reveal this bias, thereby deceiving stakeholders into trusting the model. We evaluate the manipulations on real world data sets, including COMPAS and Communities \& Crime, and find explanations can be manipulated in practice.
研究动机与目标
- 调查事后解释方法——特别是特征归因和反事实解释——是否可被操纵以隐藏模型偏差。
- 证明攻击者可训练出在解释中表现公平,但在预测中本质上不公的模型。
- 使用最先进的解释方法,评估真实世界数据集(COMPAS、Communities & Crime)对这类操纵的脆弱性。
- 展示反事实解释可被操纵,使非受保护群体获得低成本补救措施,同时在未扰动数据上仍呈现公平性。
提出的方法
- 设计一种双层优化目标,联合最小化模型分类损失,确保反事实解释中的公平性,并对输入空间施加小扰动约束。
- 使用隐式反向传播,在训练过程中通过黑箱反事实算法(如 Wachter 的算法、DiCE)进行梯度传播。
- 训练一个神经网络模型,其损失函数包含反事实补救的公平性、通过扰动降低的代价,以及小扰动约束。
- 对非受保护样本应用学习到的扰动向量 δ,以降低反事实的代价,同时在未扰动数据上保持补救代价的差异性较低。
- 使用公平性差异(受保护群体与非受保护群体平均补救代价的差异)和代价降低比率(扰动后与扰动前代价的比值)对模型进行评估。
- 使用真实世界数据集(Communities & Crime、COMPAS),并采用 LIME、SHAP、Wachter 的算法、Sparse Wachter、DiCE 和基于原型的反事实解释进行评估。
实验结果
研究问题
- RQ1攻击者能否设计出在特征归因(如 LIME、SHAP)中表现公平,但在预测中存在偏差的机器学习模型?
- RQ2反事实解释方法能否被操纵,使非受保护群体获得低成本补救,同时在未扰动数据上仍保持表面公平性?
- RQ3梯度爬升类反事实算法(如 Wachter 的算法、DiCE)在小输入扰动下产生不同结果的程度如何,从而为操纵提供可能?
- RQ4所提出的操纵策略在真实世界数据集上,就解释的忠实度和补救代价差异性而言,实际效果如何?
主要发现
- 在 Communities & Crime 数据集上,操纵后的模型准确率与基线模型相差不足 1%,表明性能下降极小。
- 在未扰动数据上,受保护群体与非受保护群体之间平均补救代价的差异极小(如 Wachter 的算法为 0.37,DiCE 为 6.99),表明表面公平性。
- 在应用扰动 δ 后,非受保护群体的补救代价显著降低,Wachter 算法的代价降低比率最高达 20.1 倍。
- 对于 DiCE,代价降低了 4.5 倍,表明操纵后非受保护个体可轻松获得低成本补救。
- 结果表明,反事实解释可被操纵以隐藏隐藏偏差,使模型在解释中看似公平,但在实际中仍不公。
- 该操纵策略在多种反事实算法(包括 Wachter 的算法、DiCE 和基于原型的方法)上均有效,表明其具有广泛的脆弱性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。