Skip to main content
QUICK REVIEW

[论文解读] Adaptive Sampling for Minimax Fair Classification

Shubhanshu Shekhar, Fields, Greg|arXiv (Cornell University)|Mar 1, 2021
Imbalanced Data Classification Techniques参考文献 27被引用 5
一句话总结

该论文提出了一种自适应采样算法 $τ_{\texttt{opt}}$,通过在面对不确定性时采用乐观策略,战略性地从代表性不足的群体中选择训练数据,从而提升机器学习中的最小最大公平性。该方法实现了接近最小最大最优的性能,在合成数据和真实世界任务(包括Cifar10、UTKFace上的卷积神经网络和表格数据)中,相比均匀采样,最差群体的准确率最高提升了4.5%。

ABSTRACT

Machine learning models trained on uncurated datasets can often end up adversely affecting inputs belonging to underrepresented groups. To address this issue, we consider the problem of adaptively constructing training sets which allow us to learn classifiers that are fair in a minimax sense. We first propose an adaptive sampling algorithm based on the principle of optimism, and derive theoretical bounds on its performance. We also propose heuristic extensions of this algorithm suitable for application to large scale, practical problems. Next, by deriving algorithm independent lower-bounds for a specific class of problems, we show that the performance achieved by our adaptive scheme cannot be improved in general. We then validate the benefits of adaptively constructing training sets via experiments on synthetic tasks with logistic regression classifiers, as well as on several real-world tasks using convolutional neural networks (CNNs).

研究动机与目标

  • 通过在最小最大公平准则下提升最差群体的预测准确率,解决机器学习中的公平性问题。
  • 开发一种自适应采样策略,动态分配训练预算给更难学习的群体,且无需事先了解群体难度。
  • 理论上分析所提出的采样方案在最小最大公平性下的收敛性和最优性。
  • 在多种数据集(包括图像和表格数据)上,使用逻辑回归和深度学习模型实证验证该方法。
  • 证明自适应采样可在推理阶段不依赖群体身份的情况下实现更优的公平性。

提出的方法

  • 核心方法 $\mathcal{A}_{\texttt{opt}}$ 采用多臂赌博机文献中的乐观主义原则,估计群体特定预测风险的不确定性,并优先从不确定性更高的群体中采样。
  • 该算法维护风险估计的置信区间,并选择上置信界最高的群体进行采样,以平衡探索与利用。
  • 理论分析建立了收敛速度的上界,并通过推导问题类别的匹配下界,证明了方法的近似最小最大最优性。
  • 为大规模应用(尤其是深度神经网络)提出 $\mathcal{A}_{\texttt{opt}}$ 的启发式变体,以提高计算效率。
  • 该方法应用于主动学习场景,根据估计的风险差异,按顺序从不同受保护群体中抽取样本。
  • 实验在多个数据集和模型(包括卷积神经网络和逻辑回归)上对比了 $\mathcal{A}_{\texttt{opt}}$ 与均匀采样和贪婪采样策略。

实验结果

研究问题

  • RQ1自适应采样策略能否通过动态分配训练数据给代表性不足的群体,从而提升最小最大公平性?
  • RQ2所提出的乐观采样算法在最小最大公平分类中是否具有理论上的近似最小最大最优性?
  • RQ3在真实世界和合成数据集中,自适应采样与均匀采样和贪婪采样相比表现如何?
  • RQ4自适应采样方法在图像和表格分类任务中,对最差群体准确率的提升程度如何?
  • RQ5该算法是否在多样化数据分布和模型架构下均能保持公平性改进?

主要发现

  • 在Cifar10上,$\mathcal{A}_{\texttt{opt}}$ 在所有属性上的最小测试准确率为 0.743 ± 0.004,相比均匀采样(0.726 ± 0.010)高出1.7个百分点。
  • 在UTKFace上,$\mathcal{A}_{\texttt{opt}}$ 的最小准确率为 0.946 ± 0.003,显著优于均匀采样(0.919 ± 0.008)。
  • 在FashionMNIST上,$\mathcal{A}_{\texttt{opt}}$ 的准确率为 0.936 ± 0.004,优于均匀采样(0.893 ± 0.002),提升4.3个百分点。
  • 在German数据集上,$\mathcal{A}_{\texttt{opt}}$ 的最小准确率为 0.721 ± 0.035,尽管数据集较小导致方差较高,但仍持续优于均匀采样(0.716 ± 0.032)。
  • 该自适应方案在所有数据集上均一致提升了最差群体的准确率,最大相对增益出现在类别不平衡或结构复杂的数据集(如Cifar10和UTKFace)中。
  • 理论分析证实,$\mathcal{A}_{\texttt{opt}}$ 的性能为近似最小最大最优,因其与问题类别的超额风险下界匹配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。