Skip to main content
QUICK REVIEW

[论文解读] Fairness guarantee in multi-class classification

Christophe Denis, Romuald Élie|arXiv (Cornell University)|Sep 28, 2021
Ethics and Social Impacts of AI参考文献 22被引用 11
一句话总结

该论文提出了一种数据驱动的后处理方法,用于多分类任务,在满足人口统计均等性(Demographic Parity, DP)的前提下,对近似公平性(ε-公平性)实现显式控制。该方法推导出最优公平分类器的闭式解,并建立了无需分布假设的公平性和风险保证,实现了快速收敛速度,在合成数据集和真实世界数据集上均优于最先进方法,同时支持任意基学习器。

ABSTRACT

Algorithmic Fairness is an established area of machine learning, willing to reduce the influence of hidden bias in the data. Yet, despite its wide range of applications, very few works consider the multi-class classification setting from the fairness perspective. We focus on this question and extend the definition of approximate fairness in the case of Demographic Parity to multi-class classification. We specify the corresponding expressions of the optimal fair classifiers. This suggests a plug-in data-driven procedure, for which we establish theoretical guarantees. The enhanced estimator is proved to mimic the behavior of the optimal rule both in terms of fairness and risk. Notably, fairness guarantees are distribution-free. The approach is evaluated on both synthetic and real datasets and reveals very effective in decision making with a preset level of unfairness. In addition, our method is competitive (if not better) with the state-of-the-art in binary and multi-class tasks.

研究动机与目标

  • 解决多分类设定下理论与实践层面公平性方法的缺失问题。
  • 将近似公平性(ε-公平性)的概念严格扩展至多分类分类任务,并提供理论分析。
  • 开发一种即插即用的流程,可在不重新训练的前提下强制实现预设水平的公平性。
  • 建立有限样本下的公平性与风险保证,包括无需分布假设的边界和收敛速率。
  • 在多样化数据集与基学习器上实现稳健性能,包括小样本标注数据集。

提出的方法

  • 推导在多分类设定下,针对精确与近似人口统计均等性约束的最优公平分类器的闭式表达式。
  • 提出两步后处理算法:首先估计条件类别概率,然后最优地调整这些概率以满足公平性约束。
  • 通过约束优化来强制实现公平性,同时最小化预测风险,确保解能逼近最优规则。
  • 建立无需分布假设的公平性保证,适用于期望情形与高概率情形。
  • 在边际型假设下证明快速收敛速率,增强理论鲁棒性。
  • 可应用于任何现成的概率分类器,实现即插即用的公平性强制。

实验结果

研究问题

  • RQ1在人口统计均等性下,针对近似公平性(ε-公平性)的多分类任务中,最优公平分类器是什么?
  • RQ2如何在无需分布假设的前提下,同时保证多分类设定下的公平性与风险?
  • RQ3在边际型假设下,所提出的公平分类器的有限样本收敛速率如何?
  • RQ4与最先进公平学习方法相比,该方法在公平性与准确率方面的表现如何?
  • RQ5该方法能否在多样化数据集与基学习器上有效强制实现预设水平的不公平性(ε)?

主要发现

  • 所提方法在期望与高概率下均实现无需分布假设的公平性保证,确保在各类数据分布下具有鲁棒性。
  • 该估计器在风险与公平性两方面均能逼近最优公平规则,且对两项指标均提供明确的有限样本边界。
  • 在边际型假设下,方法实现了快速收敛速率,表明其具备强大的理论性能。
  • 在真实与合成数据集上,该方法在公平性与准确率方面优于或匹配最先进方法(如 fair-learn 与 fair-projection),尤其在低 ε 水平下表现更优。
  • 该方法在不同基模型(reglog, RF, GBM)上均能将公平性校准保持在预设 ε 水平附近,即使在标注数据有限的情况下亦表现稳健。
  • 该算法计算高效,由于其后处理性质,显著快于内嵌式方法(如 fair-learn 与 fair-adversarial)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。