[论文解读] Beyond Adult and COMPAS: Fairness in Multi-Class Prediction
本文提出 FairProjection,一种可扩展的、与模型无关的后处理方法,通过使用 KL 散度的信息投影,将预训练模型的输出投影到公平性约束集合中,以确保多分类概率分类器的群体公平性。该方法在准确率-公平性权衡上表现优异,并可扩展至超过一百万样本的数据集,在大规模 ENEM 数据集上表现出色,且在运行时间和可扩展性方面优于最先进方法。
We consider the problem of producing fair probabilistic classifiers for multi-class classification tasks. We formulate this problem in terms of "projecting" a pre-trained (and potentially unfair) classifier onto the set of models that satisfy target group-fairness requirements. The new, projected model is given by post-processing the outputs of the pre-trained classifier by a multiplicative factor. We provide a parallelizable iterative algorithm for computing the projected classifier and derive both sample complexity and convergence guarantees. Comprehensive numerical comparisons with state-of-the-art benchmarks demonstrate that our approach maintains competitive performance in terms of accuracy-fairness trade-off curves, while achieving favorable runtime on large datasets. We also evaluate our method at scale on an open dataset with multiple classes, multiple intersectional protected groups, and over 1M samples.
研究动机与目标
- 解决多分类中存在多个潜在重叠的受保护群体时,缺乏可扩展的公平后处理方法的问题。
- 将公平干预扩展至二分类以外的场景,并超越 Adult 和 COMPAS 等常用数据集。
- 开发一种理论基础扎实、可并行化的算法,在保持公平性的同时维持预测准确性。
- 在具有复杂交叉群体结构的大规模真实世界数据集上评估公平性方法。
- 通过引入 ENEM 数据集作为常用数据集的大型替代方案,推动公平机器学习中的更广泛应用基准测试。
提出的方法
- 该方法将公平性建模为信息投影问题:使用 KL 散度将预训练的概率分类器投影到一个凸的公平性约束分布集合上。
- 通过原始模型输出的乘法后处理获得投影后的分类器,其中缩放因子由群体公平性约束推导得出。
- 采用一种迭代且可并行化的算法高效计算最优缩放因子,支持 GPU 加速和大规模部署。
- 提供了收敛性和样本复杂度的理论保证,确保在有限训练数据下的鲁棒性。
- 该方法与模型无关,适用于任何预训练的概率分类器,无论其架构如何。
- 算法在 TensorFlow 中实现,并公开发布,以确保可复现性。
实验结果
研究问题
- RQ1信息投影能否在有限数据下有效适应多分类公平性,而不仅限于已知分布的理论假设?
- RQ2在大规模数据集上,所提出的 FairProjection 方法与最先进公平干预方法相比,在准确率-公平性权衡方面表现如何?
- RQ3FairProjection 是否能在样本数超过一百万的数据集上保持公平性,同时实现更优的运行时性能?
- RQ4该方法在真实世界、高维数据集中复杂且交叉的受保护群体上是否具有良好的泛化能力?
- RQ5ENEM 数据集在多分类学习中作为公平干预评估的可行大规模基准,其适用程度如何?
主要发现
- FairProjection 在多个数据集(包括 HSLS、Adult 和 COMPAS)上实现了具有竞争力的准确率-公平性权衡,在运行时效率方面优于最先进方法。
- 该算法可有效扩展至样本数超过一百万的数据集(如巴西 ENEM 数据集),支持大规模公平性评估。
- 该方法在真实世界教育分类任务中,能有效维持多个潜在重叠的受保护群体(包括种族、性别和年龄)的公平性。
- 建立了理论上的收敛性和样本复杂度保证,确保在训练数据有限时仍具鲁棒性。
- 实现具有可并行性,可在 GPU 上高效运行,显著缩短推理时间,优于非并行化替代方案。
- 本研究证明,FairProjection 可应用于真实世界、匿名化的大规模数据集,且不损害隐私或公平性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。