[论文解读] A Distributionally Robust Approach to Fair Classification
该论文提出了一种分布鲁棒的逻辑回归模型,通过基于Wasserstein球的不确定性集和一种新颖的凸不公平度量,最小化不公平性,从而在合成数据集和真实世界数据集上提升了二分类的公平性,同时保持了最小的准确率损失。
We propose a distributionally robust logistic regression model with an unfairness penalty that prevents discrimination with respect to sensitive attributes such as gender or ethnicity. This model is equivalent to a tractable convex optimization problem if a Wasserstein ball centered at the empirical distribution on the training data is used to model distributional uncertainty and if a new convex unfairness measure is used to incentivize equalized opportunities. We demonstrate that the resulting classifier improves fairness at a marginal loss of predictive accuracy on both synthetic and real datasets. We also derive linear programming-based confidence bounds on the level of unfairness of any pre-trained classifier by leveraging techniques from optimal uncertainty quantification over Wasserstein balls.
研究动机与目标
- 解决机器学习中的算法偏见问题,特别是在招聘、贷款和刑事司法等敏感决策场景中。
- 通过在训练数据中不显式包含敏感属性的情况下防止间接歧视,克服公平性-无感知方法的局限性。
- 开发一种可处理的优化框架,利用Wasserstein球在分布不确定性下确保公平性。
- 使用Wasserstein球上的最优不确定性量化,为预训练分类器提供不公平性的置信区间。
- 证明可通过凸的、分布鲁棒的公式,在不显著牺牲预测准确率的情况下提升公平性。
提出的方法
- 使用以经验分布为中心的Wasserstein球来建模分布不确定性,构建分布鲁棒的逻辑回归模型。
- 引入一种新的凸不公平度量,以激励实现机会均等,确保受保护群体和不利群体之间的公平性。
- 通过利用Wasserstein模糊集的结构,将鲁棒优化问题转化为可处理的凸规划问题。
- 基于线性规划推导出针对任何预训练分类器的不公平性水平的置信区间,使用Wasserstein球上的最优不确定性量化。
- 将该方法应用于真实和合成数据集,调整Wasserstein半径和正则化参数,以在公平性和准确性之间取得平衡。
- 使用交叉验证并设定准确率阈值来选择最优超参数,确保公平性改进不会降低性能。
实验结果
研究问题
- RQ1分布鲁棒优化框架是否能有效降低逻辑回归中的不公平性,同时不牺牲预测准确率?
- RQ2使用Wasserstein球建模分布不确定性,如何在敏感属性约束下提升分类的公平性?
- RQ3凸不公平度量在保持计算可处理性的同时,能在多大程度上促进机会均等?
- RQ4能否使用Wasserstein球上的最优不确定性量化,为预训练分类器可靠地推导出不公平性的置信区间?
- RQ5在多样化数据集上,与现有公平学习方法相比,该方法在公平性-准确率权衡方面表现如何?
主要发现
- 所提出的DR-FLR方法在标准逻辑回归和其他基线方法的基础上,显著降低了不公平性(例如,在Drug数据集上的Det-UNF为0.04 ± 0.04),且未损失准确率。
- 在Adult数据集上,DR-FLR将确定性不公平性降低至0.06 ± 0.06,优于FLR(0.06 ± 0.06)、DOB+(0.16 ± 0.10)和LR(0.08 ± 0.06)。
- 在COMPAS数据集上,DR-FLR将概率性不公平性降低至0.03 ± 0.02,而FLR为0.10 ± 0.03,LR为0.12 ± 0.08。
- 该方法在所有指标下均显著降低了不公平性,同时保持了高准确率(例如,Drug数据集为0.79 ± 0.01,Adult数据集为0.80 ± 0.01)。
- 通过推导出的线性规划置信区间,有效界定了分布不确定性下的最坏情况不公平性,验证了该方法的鲁棒性。
- 该方法在最小准确率退化下实现了最先进的公平性改进,证明了分布鲁棒性在公平分类中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。