Skip to main content
QUICK REVIEW

[论文解读] Leveraging Labeled and Unlabeled Data for Consistent Fair Binary Classification

Evgenii Chzhen, Christophe Denis|arXiv (Cornell University)|Jun 12, 2019
Ethics and Social Impacts of AI参考文献 4被引用 18
一句话总结

本文提出了一种半监督插件方法,用于在相等机会约束下实现公平的二分类,利用标注数据估计类别条件概率,利用未标注数据校准群体特定的决策阈值。该方法在统计上是一致的且计算高效,通过利用未标注数据推导出的阈值重新校准贝叶斯分类器,实现最优的公平性与分类性能。

ABSTRACT

We study the problem of fair binary classification using the notion of Equal Opportunity. It requires the true positive rate to distribute equally across the sensitive groups. Within this setting we show that the fair optimal classifier is obtained by recalibrating the Bayes classifier by a group-dependent threshold. We provide a constructive expression for the threshold. This result motivates us to devise a plug-in classification procedure based on both unlabeled and labeled datasets. While the latter is used to learn the output conditional probability, the former is used for calibration. The overall procedure can be computed in polynomial time and it is shown to be statistically consistent both in terms of the classification error and fairness measure. Finally, we present numerical experiments which indicate that our method is often superior or competitive with the state-of-the-art methods on benchmark datasets.

研究动机与目标

  • 开发一种在相等机会公平性约束下具有统计一致性和计算高效性的公平二分类方法。
  • 推导出最优公平分类器的显式表达式,即具有群体依赖阈值的阈值化贝叶斯回归器。
  • 提出一种插件方法,利用标注数据(用于概率估计)和未标注数据(用于阈值校准)。
  • 确保该方法在保持公平性和分类准确性的前提下,可与任何现成的概率估计器结合使用。

提出的方法

  • 最优公平分类器被推导为贝叶斯回归器的阈值化版本,其中阈值的选择使得不同敏感群体的真正例率相等。
  • 提出一种两阶段方法:首先使用标注数据估计条件概率 P(Y=1|X);其次使用未标注数据估计群体特定的阈值。
  • 阈值校准被表述为一个单变量优化问题,可在多项式时间内求解。
  • 在温和的正则性假设下,证明了该方法在分类风险和公平性度量上均具有统计一致性。
  • 该方法具有通用性,可与任何一致的概率估计器结合使用,例如支持向量机、逻辑回归或随机森林。
  • 通过对偶性和鞍点分析建立了理论一致性,证明了其收敛到最优公平分类器。

实验结果

研究问题

  • RQ1在相等机会公平性约束下,最优分类器的显式形式是什么?
  • RQ2一种利用标注数据和未标注数据的半监督方法,能否在公平性和分类性能上均实现统计一致性?
  • RQ3如何仅使用未标注数据高效且一致地估计群体依赖的阈值?
  • RQ4在使用未标注数据进行公平分类时,实现一致性的最小假设是什么?
  • RQ5所提出的方法在经验上与当前最先进的公平学习方法相比表现如何?

主要发现

  • 通过使用群体依赖的阈值对贝叶斯回归器进行阈值化,可获得最优的相等机会分类器,该阈值在本文中被显式推导。
  • 所提出的方法在统计上是一致的:随着样本量增加,分类误差和公平性度量均收敛到最优值。
  • 在COMPAS、Adult、German、Arrhythmia和Drug等基准数据集上,该方法的性能优于或至少与当前最先进的方法相当。
  • 在实验中,该方法显著降低了差异相等机会(DEO)度量——例如,在Adult和German数据集上实现DEO ≈ 0.02,同时保持高准确率。
  • 基于未标注数据的校准步骤计算高效,可简化为单变量优化问题。
  • 即使敏感属性未包含在模型的函数形式中,该方法仍保持有效,展现出鲁棒性和泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。