Skip to main content
QUICK REVIEW

[论文解读] Fairness with Overlapping Groups

Forest Yang, Moustapha Cissé|arXiv (Cornell University)|Jun 24, 2020
Ethics and Social Impacts of AI参考文献 25被引用 12
一句话总结

本文提出了一种统一的概率框架,用于具有重叠敏感群体的公平多分类问题,采用贝叶斯最优分类和一致的经验风险最小化。该框架建立了理论一致性,并在真实数据集上展示了相较于基线方法更优的公平性-性能权衡。

ABSTRACT

In algorithmically fair prediction problems, a standard goal is to ensure the equality of fairness metrics across multiple overlapping groups simultaneously. We reconsider this standard fair classification problem using a probabilistic population analysis, which, in turn, reveals the Bayes-optimal classifier. Our approach unifies a variety of existing group-fair classification methods and enables extensions to a wide range of non-decomposable multiclass performance metrics and fairness measures. The Bayes-optimal classifier further inspires consistent procedures for algorithmically fair classification with overlapping groups. On a variety of real datasets, the proposed approach outperforms baselines in terms of its fairness-performance tradeoff.

研究动机与目标

  • 将现有的群体公平分类方法统一到一个概率总体分析框架下。
  • 解决在重叠群体(例如,种族和性别同时存在)中的公平性挑战,其中传统交叉公平性方法面临数据稀缺和计算障碍。
  • 设计在非可分解性能和公平性度量下具有统计一致性的算法,实现跨群体的泛化。
  • 阐明独立群体公平性(重叠)与交叉群体公平性之间的关系,表明前者并不蕴含后者。
  • 在真实世界数据集上实证验证所提出方法,展示其改进的公平性-性能权衡。

提出的方法

  • 本文推导了多分类问题中,公平性和性能度量为混淆矩阵一般线性函数时的贝叶斯最优分类器。
  • 通过引入对偶变量,将公平性约束纳入约束优化问题,利用鞍点公式化方法进行求解。
  • 采用加权经验风险最小化(wERM)和插值估计器,证明在弱条件下具有统计一致性。
  • 提出基于对偶的方法处理公平性约束,实现在大样本下收敛至最优解。
  • 该框架支持任意重叠群体定义,并可推广至F1和AUC等非可分解度量。
  • 通过VC维和Rademacher复杂度,建立收敛界,证明了理论一致性。

实验结果

研究问题

  • RQ1能否开发一个统一的概率框架,以处理重叠群体中的公平性问题,并涵盖现有方法?
  • RQ2在理论保证方面,独立群体公平性(重叠)与交叉群体公平性之间有何关系?
  • RQ3能否为具有重叠群体的公平分类设计出在一般性能和公平性度量下具有一致性和统计可靠性的算法?
  • RQ4与现有基线相比,所提出方法在真实数据集上的实证公平性-性能权衡如何?
  • RQ5所提出方法是否能避免公平性划分操纵(gerrymandering)现象,即在每个属性上实现公平,但在交集处不成立?

主要发现

  • 所提出方法在多个真实世界数据集(包括Communities and Crime、Adult Census、German Credit和Law School)上,相较于基线方法实现了更优的公平性-性能权衡。
  • 理论分析证明,加权ERM和插值估计器具有一致性,且在大样本条件下,经验估计值收敛至总体最优解。
  • 本文正式证明,在弱条件下,交叉公平性蕴含重叠群体公平性,但反之不成立,从而证实了公平性划分操纵的风险。
  • 实证结果表明,该方法在独立公平性和划分操纵公平性设置下均优于先前方法,其帕累托前沿更接近最优的左下角。
  • 该框架成功处理了非可分解度量和一般公平性约束,为多样化算法公平性应用提供了灵活性。
  • 该方法对交集子群体的数据稀缺具有鲁棒性,避免了交叉公平性中常见的指数级子群体枚举问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。