Skip to main content
QUICK REVIEW

[论文解读] Robust Fairness-aware Learning Under Sample Selection Bias

Wei Du, Xintao Wu|arXiv (Cornell University)|May 24, 2021
Ethics and Social Impacts of AI参考文献 24被引用 4
一句话总结

本文提出了一种鲁棒且公平的学习框架,以解决机器学习中的样本选择偏差问题,结合重加权方法进行偏差校正,并采用极小化极大优化以确保在分布变化下的公平性与准确性。该方法通过使用Wasserstein球建模不确定性,并在最坏情况条件下强制执行公平性,即使在测试数据不可用的情况下,也能在测试数据上实现改进的预测性能与公平性。

ABSTRACT

The underlying assumption of many machine learning algorithms is that the training data and test data are drawn from the same distributions. However, the assumption is often violated in real world due to the sample selection bias between the training and test data. Previous research works focus on reweighing biased training data to match the test data and then building classification models on the reweighed training data. However, how to achieve fairness in the built classification models is under-explored. In this paper, we propose a framework for robust and fair learning under sample selection bias. Our framework adopts the reweighing estimation approach for bias correction and the minimax robust estimation approach for achieving robustness on prediction accuracy. Moreover, during the minimax optimization, the fairness is achieved under the worst case, which guarantees the model's fairness on test data. We further develop two algorithms to handle sample selection bias when test data is both available and unavailable. We conduct experiments on two real-world datasets and the experimental results demonstrate its effectiveness in terms of both utility and fairness metrics.

研究动机与目标

  • 解决机器学习中训练数据与测试数据分布不同的样本选择偏差挑战,避免模型性能下降。
  • 在分布变化条件下确保分类模型的公平性,特别是当训练数据存在偏差时,防止在测试数据上产生不公平预测。
  • 开发一个统一框架,同时校正样本选择偏差并确保在最坏情况分布不确定性下的公平性。
  • 为两种场景(测试数据可用与不可用)提供实用算法,确保对未见测试数据的鲁棒性与公平性保障。
  • 通过在真实世界数据集上的实证评估,证明该方法的有效性,展示在效用与公平性指标上的改进。

提出的方法

  • 使用重加权估计方法,通过基于训练数据与测试数据间选择概率比率调整训练样本权重,以校正样本选择偏差。
  • 在经验训练分布为中心的Wasserstein球上应用极小化极大鲁棒估计,以确保预测准确性的最坏情况鲁棒性。
  • 通过边界公平性近似将公平性约束融入损失函数,惩罚受保护群体与非受保护群体之间风险差异的偏离。
  • 对于RFLearn 1(测试数据可用),使用训练数据与测试数据之间的密度比率估计方法估计选择概率。
  • 对于RFLearn 2(测试数据不可用),假设各聚类内选择概率均匀,并在每个聚类内使用Wasserstein球进行鲁棒估计。
  • 在最坏情况分布下优化修改后的损失函数,以确保未见测试数据上的公平性与准确性鲁棒性。

实验结果

研究问题

  • RQ1如何在确保测试数据上分类器公平性的前提下,校正训练数据中的样本选择偏差?
  • RQ2能否有效结合极小化极大鲁棒优化框架与公平性约束,以提升在分布变化下的模型可靠性?
  • RQ3当测试数据不可用于选择概率估计时,如何实现鲁棒且公平的学习?
  • RQ4使用Wasserstein模糊集对样本选择偏差下的公平性与准确性有何影响?
  • RQ5在真实世界数据集上,该框架与现有方法相比,在公平性与效用指标上的表现如何?

主要发现

  • 所提出的框架在样本选择偏差下显著提升了测试数据上的预测准确率与公平性,优于基线方法,在效用与公平性指标上均表现更优。
  • RFLearn 1(使用测试数据进行密度比率估计)在公平性与准确性上优于标准重加权方法与公平性感知基线方法。
  • RFLearn 2(专为测试数据不可用场景设计)通过利用基于聚类的选择概率假设与鲁棒优化,保持了强劲性能。
  • 使用Wasserstein球建模分布不确定性,可使预测在最坏情况分布偏移下更具鲁棒性。
  • 在极小化极大优化过程中引入公平性约束,可确保即使测试分布偏离训练分布,公平性仍能得以保持。
  • 在两个真实世界数据集上的实证结果表明,该框架能有效平衡鲁棒性与公平性,显著降低风险差异并提升准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。