[论文解读] Removing biased data to improve fairness and accuracy
该论文提出了一种黑箱预处理方法,通过识别并移除最具偏见的训练数据点,提升机器学习中的公平性与准确性。利用影响函数定位导致歧视性预测的数据点,该方法将个体歧视降至接近零,同时在六个真实世界数据集上提升了模型准确性。
Machine learning systems are often trained using data collected from historical decisions. If past decisions were biased, then automated systems that learn from historical data will also be biased. We propose a black-box approach to identify and remove biased training data. Machine learning models trained on such debiased data (a subset of the original training data) have low individual discrimination, often 0%. These models also have greater accuracy and lower statistical disparity than models trained on the full historical data. We evaluated our methodology in experiments using 6 real-world datasets. Our approach outperformed seven previous approaches in terms of individual discrimination and accuracy.
研究动机与目标
- 解决在反映过去歧视性决策的历史数据上训练的机器学习模型中普遍存在的偏见问题。
- 在不损害准确性的前提下减少模型预测中的个体歧视,尤其在招聘、贷款和刑事司法等高风险应用中。
- 开发一种适用于黑箱模型的预处理技术,无需访问模型架构或梯度信息。
- 在提升测试准确性的同时,改善公平性度量指标——个体歧视与统计差异,与公平性方法中常见的准确率权衡形成对比。
提出的方法
- 生成歧视性配对:识别仅在敏感属性上不同的相似个体,但其模型预测结果不同。
- 应用影响函数衡量每个训练数据点对歧视性配对中不一致预测的贡献程度。
- 根据其对歧视性预测的影响程度对训练数据点进行排序,优先处理最可能导致不公平结果的数据点。
- 移除最具影响力的前-k 个数据点(即最可能导致歧视的样本),以构建去偏的训练数据集。
- 在清理后的数据集上重新训练模型,以生成更公平且更准确的模型。
- 采用黑箱方法,仅需访问模型的训练和预测函数,从而可应用于专有模型。
实验结果
研究问题
- RQ1通过识别并移除导致歧视性预测的最具影响力的训练数据点,是否能在不牺牲准确性的前提下提升公平性?
- RQ2与现有公平性技术相比,该方法在个体歧视、统计差异和测试准确性方面的表现如何?
- RQ3是否可能通过数据去偏实现接近零的个体歧视,同时提升模型准确性?
- RQ4在无模型架构访问的情况下,影响函数是否能有效识别黑箱模型中的有偏训练实例?
- RQ5与现有的预处理、在线处理或后处理方法相比,移除有影响力的偏见数据点是否能带来更优的公平性-准确性权衡?
主要发现
- 所提方法在大多数实验中将个体歧视降低至0%,显著优于七种现有方法。
- 在全部八个实验中,基于去偏数据集训练的模型测试准确率均高于在完整历史数据集上训练的基线模型。
- 该方法同时改善了个体歧视与统计差异指标,与多数现有方法在公平性与准确性之间存在权衡的现象形成对比。
- 该技术在多种真实世界数据集上均表现有效,包括信贷、招聘和刑事司法相关数据。
- 在八种测试方法中,该方法是唯一一种无论优化目标为何,均能持续提升三项指标(个体歧视、统计差异与准确率)的方法。
- 影响函数成功识别出导致不公平预测的最具影响力的训练数据点,从而实现有针对性的移除,而无需从头开始重新训练模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。