Skip to main content
QUICK REVIEW

[论文解读] Are Two Heads the Same as One? Identifying Disparate Treatment in Fair Neural Networks

Michael Lohaus, Matthäus Kleindeßner|arXiv (Cornell University)|Apr 9, 2022
Ethics and Social Impacts of AI被引用 4
一句话总结

本文表明,经过公平性正则化和预处理的神经网络会隐式学习受保护属性(如种族、性别),从而导致差别待遇——这在美国法律下属于违法。本文提出一种双头网络架构,显式预测受保护属性,通过合并两支头实现对人口均等性的精确控制,并表明现有公平性方法在差别待遇方面与该方法具有法律等效性。

ABSTRACT

We show that deep networks trained to satisfy demographic parity often do so through a form of race or gender awareness, and that the more we force a network to be fair, the more accurately we can recover race or gender from the internal state of the network. Based on this observation, we investigate an alternative fairness approach: we add a second classification head to the network to explicitly predict the protected attribute (such as race or gender) alongside the original task. After training the two-headed network, we enforce demographic parity by merging the two heads, creating a network with the same architecture as the original network. We establish a close relationship between existing approaches and our approach by showing (1) that the decisions of a fair classifier are well-approximated by our approach, and (2) that an unfair and optimally accurate classifier can be recovered from a fair classifier and our second head predicting the protected attribute. We use our explicit formulation to argue that the existing fairness approaches, just as ours, demonstrate disparate treatment and that they are likely to be unlawful in a wide range of scenarios under US law.

研究动机与目标

  • 调查公平性正则化和预处理的神经网络是否隐式学习受保护属性(如种族或性别)
  • 评估此类隐式学习是否构成美国反歧视法(特别是《教育法修正案第七篇》)下的差别待遇
  • 提出一种显式预测受保护属性的双头神经网络架构,以实现对人口均等性的可控调节
  • 证明现有公平性方法在差别待遇方面与所提出的显式方法在数学和法律上等效
  • 识别因推断出的受保护属性而系统性处于不利地位的个体,揭示隐藏偏见

提出的方法

  • 训练一个深层神经网络,增加第二个分类头以显式预测受保护属性(如性别、种族),同时执行主任务
  • 训练完成后,合并两个头以生成符合人口均等性的分类器,从而在保留公平性的同时移除受保护属性头
  • 利用第二个头的预测结果,重建使用公平性正则化或预处理方法训练的公平模型的决策
  • 通过将公平模型的预测结果与第二个头的受保护属性预测结果结合,恢复出无约束(不公平)分类器
  • 使用t-SNE可视化分析在有无公平性约束下训练的模型的内部表征,显示受保护群体之间的分离度增加
  • 通过测量若个体的推断受保护属性被改变时,其预测结果发生变化的比例,量化差别待遇的程度

实验结果

研究问题

  • RQ1公平性正则化和预处理的神经网络是否隐式学习受保护属性(如种族或性别)?
  • RQ2人口均等性强制程度越强,内部表征对受保护属性的可预测性是否越高?
  • RQ3能否使用显式预测受保护属性的双头网络来重建使用正则化或预处理方法训练的公平模型的决策?
  • RQ4公平分类器的决策过程在数学上是否等价于公平分类器与受保护属性预测器的加权组合?
  • RQ5公平模型中对受保护属性的隐式学习是否构成美国反歧视法下的差别待遇?

主要发现

  • 随着公平性约束的加强,公平性正则化和预处理模型的内部表征对受保护属性的预测能力显著增强,表明其对种族或性别的隐式学习非常强烈
  • 在CelebA数据集上训练的公平模型中,高达35%的预测结果会因个体推断出的性别或种族不同而改变,表明存在显著的差别待遇
  • 所提出的双头方法能够以高保真度重建公平模型,并利用第二个头的输出从公平模型中恢复出无约束分类器
  • 使用正则化或预处理方法训练的公平模型的决策可被所提出的显式双头方法良好近似,表明其数学等价性
  • 即使公平模型受到高度约束,仍可通过将公平模型输出与第二个头的预测结果结合,从公平模型中恢复出无约束分类器
  • 该方法揭示,公平模型会因推断出的受保护属性而系统性地使某些个体处于不利地位,证实此类模型在美国法律下构成差别待遇

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。