Skip to main content
QUICK REVIEW

[论文解读] Wasserstein Robust Classification with Fairness Constraints

Yijie Wang, Viet Anh Nguyen|arXiv (Cornell University)|Mar 11, 2021
Health Systems, Economic Evaluations, Quality of Life参考文献 22被引用 5
一句话总结

本文提出了一种分布鲁棒分类框架,通过使用∞-型Wasserstein模糊集来实现基于机会均等(EO)准则的公平性。该方法推导出一种保守的混合整数规划形式,并进一步开发了一种可扩展的基于铰链损失的凸模型,在多个数据集上实现了公平性提升,且准确率损失最小。

ABSTRACT

We propose a distributionally robust classification model with a fairness constraint that encourages the classifier to be fair in view of the equality of opportunity criterion. We use a type-$\infty$ Wasserstein ambiguity set centered at the empirical distribution to model distributional uncertainty and derive a conservative reformulation for the worst-case equal opportunity unfairness measure. We establish that the model is equivalent to a mixed binary optimization problem, which can be solved by standard off-the-shelf solvers. To improve scalability, we further propose a convex, hinge-loss-based model for large problem instances whose reformulation does not incur any binary variables. Moreover, we also consider the distributionally robust learning problem with a generic ground transportation cost to hedge against the uncertainties in the label and sensitive attribute. Finally, we numerically demonstrate that our proposed approaches improve fairness with negligible loss of predictive accuracy.

研究动机与目标

  • 通过在分布鲁棒分类中整合公平性约束,解决机器学习中的算法偏见问题。
  • 使用∞-型Wasserstein模糊集对分布不确定性进行建模,中心位于经验分布。
  • 通过机会均等准则强制实现公平性,确保不同敏感群体的真正率相等。
  • 在分布不确定性下,对最坏情况下的EO不公平性度量进行保守且可处理的重构。
  • 通过基于铰链损失的凸近似避免二值变量,提升大规模数据集的可扩展性。

提出的方法

  • 使用∞-型Wasserstein模糊集对经验数据分布周围的分布不确定性进行建模。
  • 利用对偶理论推导最坏情况EO不公平性度量的保守重构形式。
  • 将鲁棒公平性问题重构为混合整数线性规划(MILP),以在中等规模问题上实现精确求解。
  • 提出一种基于铰链损失的凸近似方法,避免使用二值变量,提升大规模实例的可扩展性。
  • 引入通用的地面运输成本,以应对标签和敏感属性的不确定性。
  • 对MILP使用现成求解器,对凸近似使用基于梯度的方法,支持实际部署。
(a) $\varepsilon$ -DRFC
(a) $\varepsilon$ -DRFC

实验结果

研究问题

  • RQ1在分布不确定性下,分布鲁棒分类模型能否有效实现公平性?
  • RQ2在Wasserstein模糊集下,最坏情况下的机会均等不公平性能否被保守地重构?
  • RQ3在鲁棒公平分类中,公平性、准确率与计算效率之间的权衡如何?
  • RQ4基于铰链损失的凸近似能否在保持高公平性与准确率的同时,实现对大规模数据集的可扩展性?
  • RQ5与最先进公平感知模型相比,所提方法在公平性与预测性能方面表现如何?

主要发现

  • 所提方法在所有测试数据集上均实现了显著的公平性提升,且预测准确率损失可忽略不计。
  • ∞-型Wasserstein模糊集相比1-型,实现了更可扩展的锥重构,同时保持了统计保证。
  • 混合整数规划重构形式可显式界定EO不公平性,提供强公平性保障。
  • 基于铰链损失的凸模型(HDRFC)在所有数据集上均能在1秒内求解,即使在1000个样本时,运行时间也优于DRFLR和ε-DRFC。
  • HDRFC模型在Adult、Drug、COMPAS和Synthetic数据集上,始终优于DOB+和DRFLR在公平性-准确率权衡表现。
  • 在Arrhythmia数据集上(N=452),HDRFC和DOB+的求解时间均低于0.2秒,而ε-DRFC在N=1000时超过10分钟。
(b) HDRFC
(b) HDRFC

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。