Skip to main content
QUICK REVIEW

[论文解读] Characterizing the risk of fairwashing

Ulrich Aïvodji, Hiromi Arai|arXiv (Cornell University)|Jun 14, 2021
Law, Economics, and Judicial Systems被引用 7
一句话总结

本文通过分析其保真度-不公平性权衡,研究了公平化伪装(fairwashing)——即通过操纵的、看似公平的解释来合理化不公平的黑箱模型——的风险。研究表明,经过公平化伪装的解释在不同群体间具有泛化能力,并可在不同模型间迁移,使得检测极为困难,同时提出一种基于公平性在拉施曼集合(FaiRS)框架的风险量化方法。

ABSTRACT

Fairwashing refers to the risk that an unfair black-box model can be explained by a fairer model through post-hoc explanation manipulation. In this paper, we investigate the capability of fairwashing attacks by analyzing their fidelity-unfairness trade-offs. In particular, we show that fairwashed explanation models can generalize beyond the suing group (i.e., data points that are being explained), meaning that a fairwashed explainer can be used to rationalize subsequent unfair decisions of a black-box model. We also demonstrate that fairwashing attacks can transfer across black-box models, meaning that other black-box models can perform fairwashing without explicitly using their predictions. This generalization and transferability of fairwashing attacks imply that their detection will be difficult in practice. Finally, we propose an approach to quantify the risk of fairwashing, which is based on the computation of the range of the unfairness of high-fidelity explainers.

研究动机与目标

  • 研究事后解释系统中公平化伪装攻击的可操纵性。
  • 评估经过公平化伪装的解释是否能超越目标群体(即其他人口统计群体)泛化。
  • 评估公平化伪装攻击是否可在不重新训练的情况下在不同黑箱模型间迁移。
  • 提出一种基于公平性在拉施曼集合(FaiRS)框架的公平化伪装风险量化方法。
  • 通过展示其局限性,挑战基于保真度的检测方法在公平化伪装检测中的可行性。

提出的方法

  • 作者使用ϵ约束法求解多目标优化问题,以平衡解释保真度与公平性约束。
  • 他们训练代理模型(如规则列表、逻辑回归)来解释黑箱模型,同时施加公平性约束(如相等机会、统计独立性)。
  • 通过测量在非目标群体上的公平化伪装解释的保真度,并与原始(原告)群体上的保真度进行比较,来评估泛化性。
  • 通过在不同黑箱模型上评估相同公平化伪装解释的保真度和不公平性,来评估可迁移性。
  • 使用FaiRS框架进行风险量化,该框架计算拉施曼集合中高保真度解释的不公平性范围。
  • 在多个数据集(Adult Income、COMPAS、Default Credit、Marketing)、黑箱模型(AdaBoost、DNN、RF、XGBoost)和公平性标准(EOdds、EOpp、PE、SP)上开展实验。

实验结果

研究问题

  • RQ1经过公平化伪装的解释是否能超越其专门设计用于合理化的群体?
  • RQ2即使无法访问新模型的预测结果,公平化伪装攻击是否也能从一个黑箱模型迁移到另一个?
  • RQ3保真度是否足以作为检测公平化伪装攻击的可靠指标?
  • RQ4公平性在拉施曼集合(FaiRS)框架是否能有效量化公平化伪装的风险?
  • RQ5高保真度解释中的不公平性范围是多少,其与可操纵性有何关联?

主要发现

  • 经过公平化伪装的解释可超越原告群体泛化,其在非目标群体上的保真度与原始群体相当,表明具备广泛的合理化能力。
  • 公平化伪装攻击可在不同黑箱模型间迁移,因为相同的解释在不同模型上仍能保持高保真度,即使模型不完全相同。
  • 在不同数据集和公平性约束下,公平化伪装解释的保真度始终保持较高(例如 >0.94),表明其具有极强的可操纵性。
  • 基于保真度的公平化伪装检测方法无效,因为攻击具有高度的泛化性和可迁移性,如在不同群体和模型间均保持一致的高保真度得分。
  • FaiRS框架通过揭示高保真度解释中不公平性的范围,成功量化了公平化伪装的风险,为仅依赖保真度的指标提供了一种稳健的替代方案。
  • 在Marketing数据集上,当ϵ=0.03时,所有模型和公平性标准下的保真度均高于0.94,不公平性值始终低于0.03,表明攻击具有强韧性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。