Skip to main content
QUICK REVIEW

[论文解读] Technical Challenges for Training Fair Neural Networks

Valeriia Cherepanova, Vedant Nanda|arXiv (Cornell University)|Feb 12, 2021
Adversarial Robustness in Machine Learning参考文献 56被引用 5
一句话总结

本文研究了现有事前公平性方法在训练深度神经网络(DNNs)时的失效原因,揭示了对公平性约束的过拟合以及公平性 Gerrymandering(即在某一受保护属性上实现公平性却损害了另一属性的公平性)现象,严重削弱了公平性努力。尽管经过严格测试,适用于经典模型的方法在 DNN 的过参数化状态下失效,导致意外的不公平现象和性能下降。

ABSTRACT

As machine learning algorithms have been widely deployed across applications, many concerns have been raised over the fairness of their predictions, especially in high stakes settings (such as facial recognition and medical imaging). To respond to these concerns, the community has proposed and formalized various notions of fairness as well as methods for rectifying unfair behavior. While fairness constraints have been studied extensively for classical models, the effectiveness of methods for imposing fairness on deep neural networks is unclear. In this paper, we observe that these large models overfit to fairness objectives, and produce a range of unintended and undesirable consequences. We conduct our experiments on both facial recognition and automated medical diagnosis datasets using state-of-the-art architectures.

研究动机与目标

  • 调查事前公平性方法在深度神经网络中的有效性,其中过拟合和复杂的决策边界普遍存在。
  • 识别为何在经典模型(如支持向量机、逻辑回归)中有效的公平性约束在 DNN 的过参数化状态下失效。
  • 考察诸如公平性 Gerrymandering 等意外后果,即在某一敏感属性上提升公平性反而加剧了另一属性的不平等。
  • 评估对抗性训练与基于惩罚的公平性训练在 DNN 中的有效性,特别是在人脸识别和医学诊断任务中的表现。
  • 证明公平性度量(如等损失)无法推广到实际性能指标(如 AUC),从而削弱了公平性主张的可信度。

提出的方法

  • 在人脸识别和医学诊断任务的 ResNet-18 模型上,实证评估一系列事前公平性技术——基于惩罚的优化、对抗性训练和公平性约束。
  • 通过等损失、对抗性惩罚和标签翻转等方法应用公平性约束,以评估其在训练、验证和测试划分上的泛化能力。
  • 使用敏感属性分类器检测 DNN 是否学会利用决策边界来满足公平性约束,同时损害其他子群体。
  • 通过群体差异(如男性与女性子群体之间的 AUC 差异)衡量公平性,并追踪不同公平性干预措施下的性能下降情况。
  • 通过在受保护属性上进行随机标签翻转的消融实验,模拟数据操纵并评估公平性方法的鲁棒性。
  • 在多个公平性目标(如等机会、等预测结果)和模型架构之间进行比较,以识别失效模式。

实验结果

研究问题

  • RQ1为何在经典模型中有效的公平性约束在应用于过参数化的深度神经网络时会失效?
  • RQ2DNN 中对公平性目标的过拟合在多个敏感属性上在多大程度上导致了公平性 Gerrymandering?
  • RQ3公平性代理指标(如等损失)在 DNN 中如何转化为实际的公平性度量(如 AUC)?
  • RQ4对抗性训练是否能有效控制 DNN 中的偏差,而不会引入新的不平等?
  • RQ5标签翻转对采用公平性约束训练的 DNN 中的公平性与性能有何影响?

主要发现

  • 现有事前公平性方法在 DNN 中失效,原因在于过拟合:模型插值训练数据并在所有子群体中实现完美准确率,导致在训练过程中无法测量偏差。
  • 公平性 Gerrymandering 广泛存在:在某一敏感属性(如性别)上强制实现公平性,通常会增加另一属性(如年龄)的不平等,尤其在人脸识别系统中更为明显。
  • 即使公平性约束在训练数据上看似减少了不平等,也常常在保留数据上失效,表明泛化能力差。
  • 标签翻转实验表明,公平性干预在所有子群体中均导致 AUC 性能下降,某些情况下平均 AUC 下降高达 15%。
  • 对抗性公平性训练方法无法可靠地产生公平结果,通常无法泛化,且在测试集上受保护子群体的性能往往恶化。
  • 损失相等并不意味着公平性度量相等——例如,等损失并未带来相等的 AUC,从而削弱了 DNN 中常见公平性代理指标的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。