Skip to main content
QUICK REVIEW

[论文解读] Conditional Contrastive Learning for Improving Fairness in Self-Supervised Learning

Martin Q. Ma, Yao-Hung Hubert Tsai|arXiv (Cornell University)|Jun 5, 2021
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

本文提出条件对比学习(CCL),一种通过将正样本对和负样本对的采样条件化于敏感属性(如性别或种族)来提升自监督表示学习中公平性的方法。通过将数据增强和对比学习限制在组内配对中,CCL 在保持七个数据集上最先进的下游准确率的同时,显著降低了学习表示中的偏差,在18项指标中的11项上实现了更优的公平性。

ABSTRACT

Contrastive self-supervised learning (SSL) learns an embedding space that maps similar data pairs closer and dissimilar data pairs farther apart. Despite its success, one issue has been overlooked: the fairness aspect of representations learned using contrastive SSL. Without mitigation, contrastive SSL techniques can incorporate sensitive information such as gender or race and cause potentially unfair predictions on downstream tasks. In this paper, we propose a Conditional Contrastive Learning (CCL) approach to improve the fairness of contrastive SSL methods. Our approach samples positive and negative pairs from distributions conditioning on the sensitive attribute, or empirically speaking, sampling positive and negative pairs from the same gender or the same race. We show that our approach provably maximizes the conditional mutual information between the learned representations of the positive pairs, and reduces the effect of the sensitive attribute by taking it as the conditional variable. On seven fairness and vision datasets, we empirically demonstrate that the proposed approach achieves state-of-the-art downstream performances compared to unsupervised baselines and significantly improves the fairness of contrastive SSL models on multiple fairness metrics.

研究动机与目标

  • 为解决对比自监督学习(SSL)中公平性这一被研究不足的问题,即模型可能无意中从性别或种族等敏感属性中学习并传播偏差。
  • 开发一种在预训练过程中减轻敏感属性影响的方法,同时保持下游任务的高质量表示。
  • 改善自监督模型中的公平性度量,如人口均等、等化机会和相等机会。
  • 证明将对比学习条件化于敏感属性可生成既公平又适用于下游任务的表示。
  • 提供一种简单、可即插即用的解决方案,可轻松集成到现有对比自监督学习框架中。

提出的方法

  • CCL 将正样本对和负样本对的采样条件化于敏感属性 Z,确保正样本对和负样本对均来自同一组(如相同性别或种族)。
  • 该方法在每个敏感属性组内进行数据增强和对比学习,使模型更难将敏感属性用作区分正负样本对的代理。
  • CCL 最大化条件互信息 I(X;Y|Z) 的下界,明确排除敏感变量 Z 的信息,从而减少其对学习表示的影响。
  • 该方法通过按敏感属性分组数据并在每组内执行对比学习来实现,可轻松集成到现有 SSL 框架(如 SimCLR)中。
  • 还提出了一个更紧致的变体——Tight-CCL,通过优化条件互信息的更紧下界,进一步提升公平性。
  • 该方法通过多种视觉和表格数据集上的标准公平性度量和下游准确率进行评估。

实验结果

研究问题

  • RQ1对比自监督学习是否会无意中从性别或种族等敏感属性中学习并传播偏差?
  • RQ2如何在不损害下游性能的前提下减少敏感属性对自监督表示的影响?
  • RQ3将对比学习条件化于敏感属性是否能生成既公平又适用于下游任务的表示?
  • RQ4CCL 在公平性和准确性方面与现有注重公平性的自监督方法相比如何?
  • RQ5对对比学习进行简单的、模块化的修改——按敏感属性分组——是否能在保持性能的同时实现最先进的公平性?

主要发现

  • 在五个公平性数据集和两个视觉数据集上,CCL 在18项公平性指标中的11项上优于所有基线方法,显著提升了公平性。
  • 在 CelebA 数据集上,CCL 在吸引力属性预测任务中的人口均等差异(ΔDP)为 0.202 ± 0.03,而 SimCLR 为 0.277 ± 0.04,表明偏差显著降低。
  • 在 UTKFace 数据集上进行性别预测时,CCL 将等化机会差异(ΔEO)降低至 0.156 ± 0.02,而 SimCLR 为 0.421 ± 0.04,显示出显著的公平性提升。
  • CCL 在所有四个视觉数据集任务中保持或提升了下游准确率,其中在 CelebA 的吸引力属性预测任务中达到最高准确率 82.1 ± 0.24%。
  • Tight-CCL 作为更紧致的变体,在部分指标上表现略优,例如在 CelebA 上 ΔDP = 0.198 ± 0.03,表明对条件互信息的更紧下界有助于增强偏差减少效果。
  • 在单张 GPU 上训练 100 个周期,表格数据集耗时不到一小时,视觉数据集耗时 20–24 小时,表明训练效率较高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。