Skip to main content
QUICK REVIEW

[论文解读] Contrastive Learning for Fair Representations

Aili Shen, Xudong Han|arXiv (Cornell University)|Sep 22, 2021
Adversarial Robustness in Machine Learning参考文献 36被引用 19
一句话总结

该论文提出了一种基于对比学习的方法,通过联合优化任务准确率与公平性来减少神经网络分类器表示中的偏见:它拉近具有相同主任务标签的样本,同时推远共享同一受保护属性(如性别、种族)的样本。该方法在四个NLP和视觉基准上实现了最先进水平的公平性,计算成本极低,且主任务性能无任何下降。

ABSTRACT

Trained classification models can unintentionally lead to biased representations and predictions, which can reinforce societal preconceptions and stereotypes. Existing debiasing methods for classification models, such as adversarial training, are often expensive to train and difficult to optimise. In this paper, we propose a method for mitigating bias in classifier training by incorporating contrastive learning, in which instances sharing the same class label are encouraged to have similar representations, while instances sharing a protected attribute are forced further apart. In such a way our method learns representations which capture the task label in focused regions, while ensuring the protected attribute has diverse spread, and thus has limited impact on prediction and thereby results in fairer models. Extensive experimental results across four tasks in NLP and computer vision show (a) that our proposed method can achieve fairer representations and realises bias reductions compared with competitive baselines; and (b) that it can do so without sacrificing main task performance; (c) that it sets a new state-of-the-art performance in one task despite reducing the bias. Finally, our method is conceptually simple and agnostic to network architectures, and incurs minimal additional compute cost.

研究动机与目标

  • 解决由受保护属性(如性别、种族)与任务标签之间虚假相关性引发的神经网络分类器偏见问题。
  • 克服现有去偏方法(如对抗训练)计算成本高且难以优化的局限性。
  • 开发一种简单、与模型架构无关的方法,在保持高主任务性能的同时减少偏见。
  • 探究是否可有效利用对比学习来学习公平表示,通过鼓励任务类别内部的相似性与受保护属性群体内部的差异性。

提出的方法

  • 该方法将标准交叉熵损失与两个对比损失组件相结合:一个用于任务标签的相似性,另一个用于受保护属性的差异性。
  • 利用对比目标,最大化共享相同主任务标签的样本表示之间的相似性,而忽略其受保护属性。
  • 同时最小化共享相同受保护属性但主任务标签不同的样本表示之间的相似性。
  • 模型采用共享编码器进行端到端训练,受保护属性仅用于指导对比损失,不用于微调嵌入函数。
  • 该方法与模型架构无关,且不增加额外参数,因此轻量化且易于集成。
  • 对比损失以自监督方式应用,通过数据增强技术为任务和受保护属性视图分别生成正样本对与负样本对。

实验结果

研究问题

  • RQ1对比学习能否被有效用于学习减少神经网络分类器偏见的公平表示?
  • RQ2将任务标签与受保护属性的对比损失相结合,是否能在不降低主任务准确率的前提下提升公平性?
  • RQ3与对抗训练和后处理去偏基线方法相比,该方法在公平性与性能方面表现如何?
  • RQ4该方法在具有不同数据分布与类别结构的多样化NLP和计算机视觉任务中是否均有效?
  • RQ5在二分类与多分类设置下,对比去偏方法的有效性有何差异?

主要发现

  • 所提方法Con*在所有四个评估任务(Moji、Hate Speech、Bios和imSitu)中均实现了最先进水平的公平性,且未牺牲主任务准确率。
  • 在Bios数据集的二分类设置中(护士vs.外科医生),Con*将GAP从21.60(CE m)降低至4.88,leakage@h从98.98降至85.61,leakage@ŷ从93.67降至85.61,同时保持高准确率。
  • 在二分类设置下,Con*在减少性别偏见方面优于INLP和对抗基线方法,与CE m相比GAP降低了53%。
  • 该方法在所有四个数据集上均实现了最佳的准确率-公平性权衡,显著优于竞争性基线方法。
  • 消融研究证实,两个对比损失组件均不可或缺:任一组件的移除均会显著降低公平性表现。
  • t-SNE可视化显示,Con*的表示按情感(主任务)聚类,而按种族(受保护属性)混合,验证了该方法的设计目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。