Skip to main content
QUICK REVIEW

[论文解读] Contrastive Examples for Addressing the Tyranny of the Majority

Viktoriia Sharmanska, Lisa Anne Hendricks|arXiv (Cornell University)|Apr 14, 2020
Terrorism, Counterterrorism, and Political Violence参考文献 50被引用 10
一句话总结

本文提出了一种新颖的去偏见框架,通过生成对比样本——即对受保护属性(如性别、肤色)进行干预的合成数据点——利用生成对抗网络(GANs)来平衡训练数据。通过在真实样本和对比样本上联合训练模型,该方法在表格数据(Adult Income)和图像数据(CelebA、DiF)上均提升了公平性和准确性,减少了公平性差异,同时增强了模型的可解释性和鲁棒性。

ABSTRACT

Computer vision algorithms, e.g. for face recognition, favour groups of individuals that are better represented in the training data. This happens because of the generalization that classifiers have to make. It is simpler to fit the majority groups as this fit is more important to overall error. We propose to create a balanced training dataset, consisting of the original dataset plus new data points in which the group memberships are intervened, minorities become majorities and vice versa. We show that current generative adversarial networks are a powerful tool for learning these data points, called contrastive examples. We experiment with the equalized odds bias measure on tabular data as well as image data (CelebA and Diversity in Faces datasets). Contrastive examples allow us to expose correlations between group membership and other seemingly neutral features. Whenever a causal graph is available, we can put those contrastive examples in the perspective of counterfactuals.

研究动机与目标

  • 为解决机器学习中的‘多数人暴政’问题,即因数据不平衡导致代表性不足群体的模型性能受到偏见影响。
  • 开发一种无需依赖因果假设或结构方程的预处理公平性方法,使其适用于无需因果图的真实世界数据。
  • 通过生成受保护属性(如性别、种族)被干预的合成数据点,创建平衡的训练数据,以提升模型的公平性和准确性。
  • 通过生成具有语义意义的对比样本,增强公平模型的可解释性,支持通过 Grad-CAM 可视化模型注意力。
  • 通过强制原始样本与对比样本之间的预测一致性,支持拒绝学习,提升模型可靠性。

提出的方法

  • 通过在训练数据中对受保护属性(如性别、肤色)进行干预,生成对比样本,同时保持其他特征和标签不变。
  • 使用预训练 GAN 合成高保真度的对比样本,确保其与原始输入在语义上保持一致,适用于图像和表格数据。
  • 在原始样本与对比样本的联合数据集上训练分类器,以提升公平性和泛化能力,尤其针对代表性不足的群体。
  • 应用输出一致性约束,强制原始输入与对比输入的预测结果保持一致,当预测不一致时可触发拒绝学习。
  • 利用 Grad-CAM 可视化并解释模型注意力,结果表明:使用对比样本训练的模型更关注相关面部区域(如微笑时的嘴巴),而减少对受保护属性(如性别、年龄)的依赖。

实验结果

研究问题

  • RQ1在不依赖因果模型的前提下,通过生成受保护属性被干预的合成数据点,能否提升机器学习模型的公平性?
  • RQ2使用 GAN 生成保留语义意义且平衡群体代表性的对比样本,其有效性如何?
  • RQ3在真实样本与对比样本上联合训练,能在多大程度上减少受保护群体在真阳性率(TPR)、假阳性率(FPR)和接受率等方面的公平性差异?
  • RQ4对比样本能否增强模型可解释性,并减少预测过程中对受保护属性的依赖?
  • RQ5强制原始样本与对比样本之间预测一致性,能否提升模型的可靠性与公平性?

主要发现

  • 与基线逻辑回归相比,在 CelebA 数据集上,使用真实样本与对比样本联合训练使真阳性率差异(TPR Diff)降低了 50%。
  • 在 DiF 数据集上,该方法实现了 72.26% 的准确率,公平性指标为 0.68(TPR Diff)和 0.27(FPR Diff),优于包括公平重加权在内的各类基线方法。
  • 输出一致性约束使测试样本的预测一致率提升至 87.67%,表明模型可靠性与一致性显著增强。
  • Grad-CAM 可视化显示,使用对比样本训练的模型更关注相关面部区域(如嘴巴)而非性别或年龄线索,从而提升公平性。
  • 该方法在 DiF 数据集中减少了不同肤色群体之间的公平性指标差异,支持其在多样化人脸识别任务中促进公平性的有效性。
  • 在 Adult Income 数据集中,对比样本与反事实样本密切相关,验证了其在概念上与因果公平性原则的一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。