Skip to main content
QUICK REVIEW

[論文レビュー] Fair Decisions Despite Imperfect Predictions

Niki Kilbertus, Manuel Gomez-Rodriguez|arXiv (Cornell University)|Feb 8, 2019
Explainable Artificial Intelligence (XAI)参考文献 44被引用数 10
ひとこと要約

本稿では、偏りのある選択的ラベル付きデータで訓練された予測モデルに依存するのではなく、意思決定ポリシーを直接学習することで、重要意思決定における効用と公平性の両方を向上させることを提案する。探索をポリシー学習に組み込むことで、代表されないグループにおけるデータ不足によって引き起こされる劣悪な意思決定を回避し、厳密なデモグラフィックパリティ制約下でも、より高い効用と低い公平性違反を達成する。

ABSTRACT

Consequential decisions are increasingly informed by sophisticated data-driven predictive models. However, to consistently learn accurate predictive models, one needs access to ground truth labels. Unfortunately, in practice, labels may only exist conditional on certain decisions---if a loan is denied, there is not even an option for the individual to pay back the loan. Hence, the observed data distribution depends on how decisions are being made. In this paper, we show that in this selective labels setting, learning a predictor directly only from available labeled data is suboptimal in terms of both fairness and utility. To avoid this undesirable behavior, we propose to directly learn decision policies that maximize utility under fairness constraints and thereby take into account how decisions affect which data is observed in the future. Our results suggest the need for a paradigm shift in the context of fair machine learning from the currently prevalent idea of simply building predictive models from a single static dataset via risk minimization, to a more interactive notion of "learning to decide". In particular, such policies should not entirely neglect part of the input space, drawing connections to explore/exploit tradeoffs in reinforcement learning, data missingness, and potential outcomes in causal inference. Experiments on synthetic and real-world data illustrate the favorable properties of learning to decide in terms of utility and fairness.

研究の動機と目的

  • 選択的ラベル付きデータで訓練された予測モデルの限界、特に意思決定が観測ラベルに影響を与える状況を解決すること。
  • 静的データからの予測学習が、非理想的な初期ポリシー下で、特に効用と公平性の両面で劣悪な結果をもたらすことを示すこと。
  • 公平性制約下で意思決定ポリシーを直接最適化することで、「予測を学ぶ」から「意思決定を学ぶ」へのパラダイム転換を提案すること。
  • 初期の不確実性があるにもかかわらず、探索的ポリシーが決定的しきい値ルールに比べ、より優れた長期的効用と公平性を達成することを示すこと。
  • 現実世界の設定で公平で探索的である意思決定ポリシーを学ぶための実用的で勾配ベースのアルゴリズムを開発すること。

提案手法

  • 公平性制約下での意思決定をポリシー最適化問題として定式化し、意思決定を将来的なデータ収集に影響を与える行動として扱う。
  • 偏ったデータに過剰適合しないよう、入力空間の未観測領域を探索する確率的意思決定ポリシーを勾配ベースで学習するアルゴリズムを導入する。
  • 特徴量 x と感受性属性 z を入力として受け取り、意思決定 d を出力する確率的関数 π(x,z) としてポリシーをモデル化し、エントロピー正則化によって探索を制御する。
  • 時間経過にわたる報酬の集約を考慮する効用関数を用い、ラグランジュ乗数 λ を用いて公平性ペナルティ(例:デモグラフィックパリティ)を統合する。
  • 各更新が将来的なデータ可用性と公平性に与える影響を反映するように、ミニバッチデータ上でオンライン更新を実行してポリシーを訓練する。
  • ホールドアウトテストセット上で公平性指標(例:デモグラフィックパリティ)と効用を推定し、ポリシー性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1予測モデルに依存するのではなく、直接意思決定ポリシーを学習することで、選択的ラベル付きの設定下でも、より高い効用と公平性を達成できるか?
  • RQ2意思決定ポリシーにおける探索は、決定的しきい値ルールに比べ、長期的な効用と公平性にどのように影響を与えるか?
  • RQ3入力空間の未観測領域を探索するポリシーは、データバイアスによって引き起こされる公平性違反をどの程度低減できるか?
  • RQ4初期ポリシーが劣悪な状況下でも、「予測を学ぶ」から「意思決定を学ぶ」に転換することで、より優れたパフォーマンスが達成可能か?
  • RQ5データ収集のフィードバックループを考慮するポリシー学習フレームワークに、どのようにして公平性制約を統合できるか?

主な発見

  • t=100 の訓練ステップ以降、公平性制約がなくても、探索的ポリシーは決定的しきい値ルールに比べてより高い有効な効用を示す。
  • 明示的な公平性制約がなくても、探索的ポリシーは決定的ルールよりもデモグラフィックパリティ違反を顕著に低減しており、内在的な公平性の恩恵があることが示唆される。
  • λ を用いた公平性制約を適用した場合、本手法は完全なデモグラフィックパリティを達成するとともに、非公平なベースラインと同等の効用水準を維持する。
  • 効用と公平性のトレードオフが適切に管理されている:λ を増加させると効用は低下するが、完全なデモグラフィックパリティが達成可能であり、公平性が制御可能である。
  • COMPASデータセットでは、t=200 での最終ポリシーが、限られた表現力を持つロジスティック回帰モデルクラスを用いながらも、決定的しきい値ルールに比べて低い公平性違反と高い効用を達成した。
  • 結果から、探索は効用向上に有益であるだけでなく、データ中の代表されないグループにアクセスすることで、本質的に公平性を向上させることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。