[论文解读] Achieving Fairness at No Utility Cost via Data Reweighing with Influence
本文提出了一种数据重加权方法,利用影响函数为训练数据分配细粒度的、样本特定的权重,在不损失预测效用的前提下提升公平性。通过约束线性规划优化权重,该方法在多个表格型数据集上实现了无成本的公平性——在保持或略微提升效用的同时增强平等机会,优于基线方法。
With the fast development of algorithmic governance, fairness has become a compulsory property for machine learning models to suppress unintentional discrimination. In this paper, we focus on the pre-processing aspect for achieving fairness, and propose a data reweighing approach that only adjusts the weight for samples in the training phase. Different from most previous reweighing methods which usually assign a uniform weight for each (sub)group, we granularly model the influence of each training sample with regard to fairness-related quantity and predictive utility, and compute individual weights based on influence under the constraints from both fairness and utility. Experimental results reveal that previous methods achieve fairness at a non-negligible cost of utility, while as a significant advantage, our approach can empirically release the tradeoff and obtain cost-free fairness for equal opportunity. We demonstrate the cost-free fairness through vanilla classifiers and standard training processes, compared to baseline methods on multiple real-world tabular datasets. Code available at https://github.com/brandeis-machine-learning/influence-fairness.
研究动机与目标
- 为通过重加权训练样本解决算法决策中持续存在的公平性-效用权衡问题。
- 开发一种预处理方法,在不修改模型架构或训练过程的前提下纠正数据偏差。
- 通过样本级影响估计实现无成本公平性——在不降低预测性能的情况下提升公平性。
- 提供一种实用、即插即用的解决方案,兼容现有机器学习流水线和标准分类器。
提出的方法
- 该方法使用影响函数计算单个样本对公平性和效用的影响,影响函数可估计移除训练样本的影响而无需完整微调。
- 将其表述为一个线性规划问题,以在公平性约束(如平等机会)和效用约束(如预测准确率)下确定最优重加权。
- 在验证集上测量影响以确保泛化能力,该方法作为单次重加权步骤在标准训练前应用。
- 该方法降低误标或不公平影响较大的样本权重,同时保留高质量样本,最大限度减少效用损失。
- 引入超参数以校正移除样本组时的影响近似误差,提升鲁棒性。
- 该方法在真实世界表格型数据集上使用标准分类器和标准训练流程进行评估。
实验结果
研究问题
- RQ1是否可以在机器学习模型中实现公平性提升而无需付出效用代价?
- RQ2样本级影响估计是否能实现比群体级均匀加权更精确的重加权?
- RQ3是否存在一种重加权策略,可在保持或提升预测性能的同时增强公平性?
- RQ4影响函数在多大程度上能准确预测移除样本对公平性和效用的实际影响?
- RQ5预处理方法是否能在多种真实世界数据集中实现无成本公平性?
主要发现
- 所提方法在大多数数据集上实现了无效用代价的公平性提升,实证上打破了传统公平性-效用权衡。
- 与基线方法不同,后者常通过降低效用来提升公平性,本方法在增强平等机会的同时保持或略微提升效用。
- 影响函数能准确预测留一法微调后实际的模型变化,在大多数情况下皮尔逊相关系数(rho > 0.8)较高。
- 该方法在多个数据集上均优于启发式、学习型和对抗性重加权基线,在公平性和效用稳定性方面表现更优。
- 即使效用略有下降(例如在基线率差异较大的情况下),公平性增益依然显著,体现出强鲁棒性。
- 该方法在不同模型和数据集上均有效,包括Adult和Compas数据集,且与标准训练流水线兼容。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。