[论文解读] Reranking individuals: The effect of fair classification within-groups
本文挑战了传统偏见缓解研究中仅关注组间公平性度量的范式,提出应转向在应用公平性约束前,优先优化组内排序准确性(基于模型预测得分)的新范式。研究证明,依赖事后标签调整会导致不切实际的正样本率,降低现实可行性,因此主张基于AUC优化的排序,从各子群中选择排名靠前的个体,以实现公平性与实际可行性的统一。
Artificial Intelligence (AI) finds widespread application across various domains, but it sparks concerns about fairness in its deployment. The prevailing discourse in classification often emphasizes outcome-based metrics comparing sensitive subgroups without a nuanced consideration of the differential impacts within subgroups. Bias mitigation techniques not only affect the ranking of pairs of instances across sensitive groups, but often also significantly affect the ranking of instances within these groups. Such changes are hard to explain and raise concerns regarding the validity of the intervention. Unfortunately, these effects remain under the radar in the accuracy-fairness evaluation framework that is usually applied. Additionally, we illustrate the effect of several popular bias mitigation methods, and how their output often does not reflect real-world scenarios.
研究动机与目标
- 解决现有偏见缓解评估方法仅关注组间公平性度量的局限性,常忽略组内排序变化的影响。
- 指出当前基准测试方法在正样本率不切实际的条件下比较不同方法,导致对性能的误导性结论。
- 主张在公平感知机器学习中,评估与个体选择的基础应为预测得分,而不仅仅是最终标签。
- 提出两步框架:首先通过AUC优化子群排序准确性;其次在公平性与容量约束下选择排名靠前的个体。
- 证明事后标签调整常导致不可行的正样本率,损害实际应用可行性。
提出的方法
- 提出两阶段评估框架:首先,基于方法在各子群中产生最准确排序的能力(以AUC为度量)来评估偏见缓解技术。
- 使用预测得分(而非最终标签)对每个敏感群体内的个体进行排序,确保子群内精度优先。
- 仅在确立最优组内排序后,才应用公平性约束(如人口均等性),并从各组中选取排名靠前的个体。
- 引入一种考虑约束的筛选流程,尊重现实世界中正样本率的限制(如贷款配额、招生名额)。
- 不以最终标签比较缓解方法,而以底层基于得分的排序质量为比较依据,避免不具可比性的比较。
- 证明事后处理方法保持了原始组内排序,而预处理与内嵌方法常扭曲这些排序,影响组内公平性。
实验结果
研究问题
- RQ1不同偏见缓解方法如何影响各敏感群体内部个体的排序?
- RQ2为何仅依赖组间公平性度量不足以评估真实应用场景中的偏见缓解技术?
- RQ3当前基准测试实践在多大程度上因比较正样本率差异巨大的方法而产生误导?
- RQ4是否可通过两阶段框架(先优化组内排序准确性,再施加公平性约束)实现更现实且公平的结果?
- RQ5在资源受限环境中,预测得分与最终标签相比,在引导公平且可行的决策中表现如何?
主要发现
- Adult Income数据集显示,偏见缓解方法产生的正样本率范围为0.5%至39.3%,而实际正样本率为23.9%,凸显在不可比条件下比较方法的风险。
- 事后处理方法保持了组内实例的原始排序,而预处理与内嵌方法常改变这些排序,可能损害组内公平性。
- AUC度量能有效捕捉组内排序质量,因此作为评估标准优于应用于最终标签的准确率或公平性度量。
- 仅依赖最终预测标签进行比较会导致误导性结论,因为具有相同准确率的方法可能处于截然不同的正样本率水平,使其在真实场景中不可行。
- 所提出的框架可防止容量利用不足,并避免产生不切实际的过高或过低正样本率,更符合贷款配额或招生名额等实际约束。
- 即使使用事后处理方法,公平性结果仍取决于底层基于得分排序的质量,而这一关键因素常被标准评估所忽略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。