Skip to main content
QUICK REVIEW

[论文解读] Fairwashing: the risk of rationalization

A\"ivodji, Ulrich, Arai, Hiromi|arXiv (Cornell University)|Jan 28, 2019
Explainable Artificial Intelligence (XAI)被引用 35
一句话总结

本文提出了'公平洗白'(fairwashing)——即在本质上不公的黑箱机器学习模型中,通过欺骗性地使用模型解释来虚假地暗示其公平性。作者提出LaundryML,一种正则化规则列表枚举算法,能够从不公平的黑箱模型中生成更公平、高保真度的代理模型。通过实证评估表明,此类合理化解释可显著降低不公平性,同时保持与原始模型的高度一致性。

ABSTRACT

Black-box explanation is the problem of explaining how a machine learning model -- whose internal logic is hidden to the auditor and generally complex -- produces its outcomes. Current approaches for solving this problem include model explanation, outcome explanation as well as model inspection. While these techniques can be beneficial by providing interpretability, they can be used in a negative manner to perform fairwashing, which we define as promoting the false perception that a machine learning model respects some ethical values. In particular, we demonstrate that it is possible to systematically rationalize decisions taken by an unfair black-box model using the model explanation as well as the outcome explanation approaches with a given fairness metric. Our solution, LaundryML, is based on a regularized rule list enumeration algorithm whose objective is to search for fair rule lists approximating an unfair black-box model. We empirically evaluate our rationalization technique on black-box models trained on real-world datasets and show that one can obtain rule lists with high fidelity to the black-box model while being considerably less unfair at the same time.

研究动机与目标

  • 揭露'公平洗白'的风险——即通过模型解释的欺骗性使用,制造出不公平模型是道德的错觉。
  • 证明黑箱解释可被系统性地操纵,以将不公平决策合理化为公平。
  • 开发一种通用的、公平性受限的方法,从不公平的黑箱模型中生成可解释的、高保真度的代理模型。
  • 通过实证验证,此类合理化解释可显著降低原始模型的不公平性,同时保持高保真度。
  • 提高机器学习社区对依赖事后解释而未验证其公平性所带来伦理风险的认识。

提出的方法

  • 提出LaundryML,一种正则化规则列表枚举算法,旨在同时优化对黑箱模型的保真度和公平性(依据预定义指标)。
  • 采用双目标优化:最大化对黑箱模型的保真度,最小化不公平性,由公平性正则化参数β控制。
  • 将该算法应用于生成全局(模型解释)和局部(结果解释)代理模型,实现在两个层面的合理化。
  • 采用贪心、迭代式的规则列表搜索,基于保真度和公平性约束对候选规则进行剪枝与优化。
  • 通过将优化适应于整个数据集或单个实例,支持全局与局部解释的合理化。
  • 方法具有通用性,与底层黑箱模型和公平性度量无关,具备广泛适用性。

实验结果

研究问题

  • RQ1事后解释能否被系统性地操纵,以在本质上不公的黑箱模型中制造出公平的错觉?
  • RQ2代理模型在多大程度上既能高度保真于不公平的黑箱模型,又能显著优于其公平性?
  • RQ3是否可能仅通过黑箱访问,生成可解释的规则列表,将不公平决策合理化为公平?
  • RQ4在合理化过程中,保真度与公平性之间的权衡如何体现?
  • RQ5此类合理化解释能否被识别为欺骗性?还是与真正的公平性无从区分?

主要发现

  • 在Adult Income数据集上,最佳合理化模型的保真度为0.908,不公平性为0.058,相比原始黑箱模型,不公平性降低超过一半。
  • 在ProPublica再犯率数据集上,最佳模型的保真度为0.748,不公平性为0.080,再次显示出不公平性的显著降低。
  • 对于局部结果解释,在β = 0.9时,一个完全公平的模型(不公平性 = 0.0)能够解释Adult Income数据集中所有少数族裔群体被拒之人的决策。
  • 在两个数据集中,FairML得出的特征重要性相对排名发生显著变化:敏感属性(如性别、种族)从前列降至接近底部。
  • 在β = 0.9时,合理化模型与黑箱模型在少数族裔用户中达成一致的比例达到100%,表明其具有强大的覆盖范围和一致性。
  • 合理化模型被特别针对'诉讼群体'进行优化,暗示其在新出现的、未见过的少数族裔成员上保真度可能下降,凸显潜在的检测挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。