[论文解读] Recovering from Biased Data: Can Fairness Constraints Improve Accuracy?
本文表明,即使在不利群体样本不足或标签错误的情况下,对经验风险最小化(ERM)应用平等机会公平性约束,也能从有偏的训练数据中恢复贝叶斯最优分类器。关键结果是,公平性约束可通过纠正标签和采样中的系统性偏差,提升在真实数据分布上的准确率。
Multiple fairness constraints have been proposed in the literature, motivated by a range of concerns about how demographic groups might be treated unfairly by machine learning classifiers. In this work we consider a different motivation; learning from biased training data. We posit several ways in which training data may be biased, including having a more noisy or negatively biased labeling process on members of a disadvantaged group, or a decreased prevalence of positive or negative examples from the disadvantaged group, or both. Given such biased training data, Empirical Risk Minimization (ERM) may produce a classifier that not only is biased but also has suboptimal accuracy on the true data distribution. We examine the ability of fairness-constrained ERM to correct this problem. In particular, we find that the Equal Opportunity fairness constraint (Hardt, Price, and Srebro 2016) combined with ERM will provably recover the Bayes Optimal Classifier under a range of bias models. We also consider other recovery methods including reweighting the training data, Equalized Odds, and Demographic Parity. These theoretical results provide additional motivation for considering fairness interventions even if an actor cares primarily about accuracy.
研究动机与目标
- 研究当训练数据对不利群体存在偏差时,公平性约束是否能提升模型准确率。
- 建模现实中的数据偏差形式,包括正样本在不利群体中代表性不足,以及对不利群体成员的误标。
- 评估在训练数据被污染的情况下,公平性约束学习是否能恢复真实的贝叶斯最优分类器。
- 比较不同公平性约束(平等机会、平等 odds、人口均等)与重加权方法在纠正偏差方面的有效性。
- 为使用公平性约束不仅实现公平性,而且在有偏数据设置中提升准确率,提供理论依据。
提出的方法
- 形式化一个二分类设置,包含两个群体:优势群体(A)和不利群体(B),其中真实贝叶斯最优分类器 h_A* 和 h_B* 具有相同的正样本率 p 和相同的误差率 η。
- 通过两种机制建模偏差:不利群体样本代表性不足(速率 ν)和将正样本误标为负样本的概率为 ν。
- 将平等机会约束应用于 ERM,要求不利群体的真正阳性率与优势群体相等,即 P(y=1|h_B*(x)=1) = P(y=1|h_A*(x)=1)。
- 通过分析重加权似然比,推导出约束 ERM 解恢复真实贝叶斯最优分类器 h* = (h_A*, h_B*) 的条件。
- 比较替代方法:对训练数据进行重加权以满足人口均等,以及直接对 ERM 应用平等 odds 或人口均等约束。
- 通过理论分析表明,平等机会约束在一系列偏差模型下可保证恢复 h*,而其他方法在相同条件下会失败。
实验结果
研究问题
- RQ1当训练数据对不利群体存在偏差时,像平等机会这样的公平性约束是否能提升模型准确率?
- RQ2在存在数据偏差的情况下,平等机会约束 ERM 在何种条件下能恢复贝叶斯最优分类器?
- RQ3在纠正代表性不足和误标导致的偏差方面,不同公平性约束(平等机会、平等 odds、人口均等)表现如何?
- RQ4对训练数据进行重加权以满足人口均等是否能提升有偏数据设置下的准确率?
- RQ5为何平等机会在纠正数据偏差方面优于密切相关公平性概念(如平等 odds)?
主要发现
- 在涵盖代表性不足和标签偏差的广泛偏差模型下,平等机会约束 ERM 可保证恢复贝叶斯最优分类器 h* = (h_A*, h_B*)。
- 当两个群体的贝叶斯最优分类器具有相同的正样本率 p 和相同的误差率 η,且误差均匀分布时,恢复是保证的。
- 对训练数据进行重加权以满足人口均等可在某些偏差模型中提升准确率,但在其他模型中会失败,而平等机会则不会。
- 平等机会约束在纠正偏差方面优于平等 odds,凸显了实践中不同公平性概念之间的关键差异。
- 分析表明,公平性约束可通过抵消训练数据中的系统性偏差,提升在真实数据分布上的准确率。
- 结果表明,公平性干预与准确率并不冲突,且在从有偏数据中恢复正确模型方面至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。