Skip to main content
QUICK REVIEW

[论文解读] The Rich Get Richer: Disparate Impact of Semi-Supervised Learning

Zhaowei Zhu, Tianyi Luo|arXiv (Cornell University)|Oct 12, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用 8
一句话总结

本文揭示了半监督学习(SSL)可能加剧公平性差异,其中基线准确率较高('富裕')的子群体从SSL中获益更多,而基线准确率较低('贫困')的子群体可能面临性能下降。作者提出了收益比度量来量化这种不平等影响,并通过理论和实验表明,数据平衡和增加标注数据可减轻图像和文本分类任务中的此类不公。

ABSTRACT

Semi-supervised learning (SSL) has demonstrated its potential to improve the model accuracy for a variety of learning tasks when the high-quality supervised data is severely limited. Although it is often established that the average accuracy for the entire population of data is improved, it is unclear how SSL fares with different sub-populations. Understanding the above question has substantial fairness implications when different sub-populations are defined by the demographic groups that we aim to treat fairly. In this paper, we reveal the disparate impacts of deploying SSL: the sub-population who has a higher baseline accuracy without using SSL (the "rich" one) tends to benefit more from SSL; while the sub-population who suffers from a low baseline accuracy (the "poor" one) might even observe a performance drop after adding the SSL module. We theoretically and empirically establish the above observation for a broad family of SSL algorithms, which either explicitly or implicitly use an auxiliary "pseudo-label". Experiments on a set of image and text classification tasks confirm our claims. We introduce a new metric, Benefit Ratio, and promote the evaluation of the fairness of SSL (Equalized Benefit Ratio). We further discuss how the disparate impact can be mitigated. We hope our paper will alarm the potential pitfall of using SSL and encourage a multifaceted evaluation of future SSL algorithms.

研究动机与目标

  • 调查半监督学习(SSL)是否对某些子群体相较于其他群体产生不成比例的益处。
  • 理解SSL中不平等影响的根本原因,特别是当子群体按类别级别或人口统计级别准确率定义时。
  • 提出一种新的公平性评估度量——收益比,以衡量在应用SSL后各子群体模型准确率的归一化提升。
  • 评估并建议实用的缓解策略——如数据平衡和增加标注数据——以减少SSL中的不公平性。
  • 推动对SSL算法的多维度评估,超越平均准确率,强调模型改进中的公平性。

提出的方法

  • 作者开发了一个统一的分析框架,将SSL中的一致性正则化与带噪声标签的学习联系起来,从而实现泛化误差的理论分析。
  • 他们推导出SSL泛化误差的上界,表明小规模监督数据集会导致异质性误差,从而引发不平等影响。
  • 提出一种新度量——收益比,用于量化每个子群体在应用SSL后准确率的归一化提升。
  • 收益比用于检测SSL中的“马太效应”:基线准确率高的群体获得更大增益(比率 >1),而基线准确率低的群体可能受损(负比率)。
  • 作者在CIFAR-10、CIFAR-100和Jigsaw毒性数据集上,使用多种SSL方法(包括MixMatch)对收益比进行了实证评估。
  • 他们应用两种缓解策略:平衡标注和未标注数据,以及收集更多标注数据,并评估其对减少收益比方差和负比率的影响。

实验结果

研究问题

  • RQ1半监督学习是否导致按类别或人口统计群体定义的子群体间改进不均?
  • RQ2为何基线准确率较高的子群体从SSL中受益更多,而其他群体可能面临性能下降?
  • RQ3收益比度量能否有效揭示并量化SSL在不同群体中的不平等影响?
  • RQ4数据平衡和增加标注数据在多大程度上能缓解SSL改进中的不公平性?
  • RQ5观察到的马太效应——'强者愈强,弱者愈弱'——在SSL中是否存在理论基础?

主要发现

  • ‘强者愈强’现象在SSL中普遍存在:基线准确率高的子群体持续获得更高的收益比,部分超过1,表明增益被放大。
  • 在CIFAR-10的非平衡设置下,狗类(基线准确率低)在MixMatch下收益比为-9.57%,表明SSL后性能下降。
  • 在Jigsaw数据集中,非平衡设置下8个种族身份中有4个出现负收益比,凸显了文本分类中的显著公平性问题。
  • 在Jigsaw数据集上,使用800个总标注样本对标注和未标注数据进行平衡后,收益比的标准差降至7.64%,仅一个群体出现负收益比。
  • 收益比度量有效捕捉了不平等影响,并基于理论泛化界,验证了其在SSL公平性评估中的适用性。
  • 数据平衡和收集更多标注数据等缓解策略显著降低了收益比的标准差,并在大多数子群体中消除了负向改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。