Skip to main content
QUICK REVIEW

[論文レビュー] Robust Fairness-aware Learning Under Sample Selection Bias

Wei Du, Xintao Wu|arXiv (Cornell University)|May 24, 2021
Ethics and Social Impacts of AI参考文献 24被引用数 4
ひとこと要約

本稿では、機械学習におけるサンプル選択バイアスに対処するためのロバストで公平な学習フレームワークを提案する。再重み付けによるバイアス補正と、分布シフト下でも公平性と正確性を保証するミニマックス最適化を組み合わせたものである。Wassersteinボールを用いた不確実性のモデル化と、最悪ケース条件下での公平性の強制により、テストデータが利用可能でない場合でも、予測性能と公平性の両方が向上する。

ABSTRACT

The underlying assumption of many machine learning algorithms is that the training data and test data are drawn from the same distributions. However, the assumption is often violated in real world due to the sample selection bias between the training and test data. Previous research works focus on reweighing biased training data to match the test data and then building classification models on the reweighed training data. However, how to achieve fairness in the built classification models is under-explored. In this paper, we propose a framework for robust and fair learning under sample selection bias. Our framework adopts the reweighing estimation approach for bias correction and the minimax robust estimation approach for achieving robustness on prediction accuracy. Moreover, during the minimax optimization, the fairness is achieved under the worst case, which guarantees the model's fairness on test data. We further develop two algorithms to handle sample selection bias when test data is both available and unavailable. We conduct experiments on two real-world datasets and the experimental results demonstrate its effectiveness in terms of both utility and fairness metrics.

研究の動機と目的

  • 訓練データとテストデータの分布が異なるというサンプル選択バイアスの課題に対処すること。これにより、モデルの性能が低下する。
  • 特に、バイアスがかかる訓練データがテストデータにおける不公平な予測を引き起こす可能性がある状況下で、分類モデルの公平性を保証すること。
  • サンプル選択バイアスの是正と、最悪ケースの分布的不確実性下での公平性の両方を同時に実現する統合的フレームワークの開発。
  • テストデータが利用可能かどうかにかかわらず実用的なアルゴリズムを提供し、未確認のテストデータにおけるロバスト性と公平性の保証を達成すること。
  • 実世界のデータセットを用いた実験的評価を通じて、本手法の有効性を示し、ユーティリティと公平性の両方の指標で改善が得られることを示すこと。

提案手法

  • 訓練データとテストデータ間の選択確率比に基づいて訓練例の重みを調整することで、再重み付け推定を用いてサンプル選択バイアスを是正する。
  • 経験的訓練分布を中心とするWassersteinボール上でのミニマックスロバスト推定を適用し、予測精度の最悪ケースにおけるロバスト性を確保する。
  • 境界公平性近似を介して損失関数に公平性制約を組み込み、保護群と非保護群間のリスク差の逸脱をペナルティ化する。
  • RFLearn 1(テストデータあり)では、訓練データとテストデータ間の密度比推定を用いて選択確率を推定する。
  • RFLearn 2(テストデータなし)では、クラスタごとに一様な選択確率を仮定し、各クラスタ内でWassersteinボール内での推定をロバスト化する。
  • 未確認のテストデータに対して、最悪分布下での損失関数の最適化を実施し、公平性と正確性のロバスト性を保証する。

実験結果

リサーチクエスチョン

  • RQ1訓練データのサンプル選択バイアスを是正しつつ、テストデータにおける分類器の公平性を保証する方法は何か?
  • RQ2ミニマックスロバスト最適化フレームワークを公平性制約と効果的に組み合わせることで、分布シフト下でのモデル信頼性が向上するか?
  • RQ3テストデータが利用可能でない状況で、どのようにしてロバストかつ公平な学習を達成できるか?
  • RQ4Wassersteinアンビギュイティ集合を用いることで、サンプル選択バイアス下での公平性と正確性にどのような影響を与えるか?
  • RQ5実世界のデータセットにおいて、本手法は既存の手法と比較して、公平性とユーティリティ指標の両面で優れているか?

主な発見

  • 提案フレームワークは、サンプル選択バイアス下でもテストデータにおける予測精度と公平性を顕著に向上させ、ベースライン手法を上回る。ユーティリティと公平性の両指標で優れた結果を示した。
  • RFLearn 1(テストデータあり)は、標準的な再重み付けおよび公平性に配慮したベースラインと比較して、より高い公平性と正確性を達成した。
  • テストデータが利用できない場合を想定したRFLearn 2は、クラスタベースの選択確率仮定とロバスト最適化を活用することで、高い性能を維持した。
  • 分布的不確実性をモデル化するためのWassersteinボールの使用により、最悪ケースの分布シフト下でもよりロバストな予測が可能になった。
  • ミニマックス最適化中に公平性制約を組み込むことで、テスト分布が訓練分布から逸脱しても公平性が維持された。
  • 2つの実世界データセットを用いた実験的結果から、本フレームワークがロバスト性と公平性の両方を効果的にバランスさせ、リスク差と正確性の両面で顕著な改善が得られることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。