Skip to main content
QUICK REVIEW

[論文レビュー] Learning to be Fair: A Consequentialist Approach to Equitable Decision-Making

Alex Chohlas-Wood, Madison Coots|arXiv (Cornell University)|Sep 18, 2021
Advanced Causal Inference Techniques被引用数 8
ひとこと要約

本論文は、公平性指標(例:支出の平等)と成果(例:裁判廷出廷率)の妥当な妥当性を優先する、結果主義的枠組みを提案する。この枠組みは、データから最適なポリシーを学習するため、凸最適化を用いた文脈的バンディットアルゴリズムを採用しており、公平性の公理的制約に比べて、下流の結果を明示的にモデル化し、予算制約下での効率的かつユーティリティ最大化のポリシー学習を可能にする。

ABSTRACT

In an attempt to make algorithms fair, the machine learning literature has largely focused on equalizing decisions, outcomes, or error rates across race or gender groups. To illustrate, consider a hypothetical government rideshare program that provides transportation assistance to low-income people with upcoming court dates. Following this literature, one might allocate rides to those with the highest estimated treatment effect per dollar, while constraining spending to be equal across race groups. That approach, however, ignores the downstream consequences of such constraints, and, as a result, can induce unexpected harms. For instance, if one demographic group lives farther from court, enforcing equal spending would necessarily mean fewer total rides provided, and potentially more people penalized for missing court. Here we present an alternative framework for designing equitable algorithms that foregrounds the consequences of decisions. In our approach, one first elicits stakeholder preferences over the space of possible decisions and the resulting outcomes--such as preferences for balancing spending parity against court appearance rates. We then optimize over the space of decision policies, making trade-offs in a way that maximizes the elicited utility. To do so, we develop an algorithm for efficiently learning these optimal policies from data for a large family of expressive utility functions. In particular, we use a contextual bandit algorithm to explore the space of policies while solving a convex optimization problem at each step to estimate the best policy based on the available information. This consequentialist paradigm facilitates a more holistic approach to equitable decision-making.

研究の動機と目的

  • 公平性指標(例:人種グループ間の支出の平等)に起因する公理的公平性制約の限界を是正する。これらは、意図しない形で全体の効果性を低下させ、弱い立場のグループに悪影響を及えることがある。
  • ステークホルダーの好みを用いて、公平性指標と成果の有効性の間の現実世界のトレードオフをモデル化する枠組みを開発する。
  • 文脈的バンディットと凸最適化を統合することで、動的かつデータが限られた環境において、最適な意思決定ポリシーを効率的に学習する仕組みを提供する。
  • 実世界のシミュレーションにおいて、結果主義的ポリシー学習が、従来の公平性制約およびグリーディーベースラインを上回ることを示す。
  • 複雑で多次元的なステークホルダー価値を反映する、実用的でスケーラブルな公平なアルゴリズム設計手法を提供する。

提案手法

  • アンケートや対比較を通じて、ステークホルダーが公平性(例:人種グループ間の支出の平等)と成果の有効性(例:裁判廷出廷率)のトレードオフに対してどのような好みを持っているかを収集する。
  • 意思決定ポリシー最適化を、表現力のある広範なユーティリティ関数族上のユーティリティ最大化問題として定式化する。
  • 予算制約を維持し、潜在的成果に関する信念を更新しながら、ポリシー空間を探索する文脈的バンディットフレームワークを用いる。
  • 各ステップで、現在の不確実性下での期待ユーティリティが最大となるポリシーを推定するため、凸最適化問題(特に線形計画法)を解く。
  • 上界信頼区間(UCB)に基づく戦略を採用し、探索と活用のバランスを取る。結果効果の楽観的推定値を用いる。
  • 遅延したフィードバックに対応するため、代理の結果(例:予約確認)を統合し、ポリシー更新を支援する。

実験結果

リサーチクエスチョン

  • RQ1人種グループ間の一人当たりの支出を平等に保つといった、公理的公平性制約は、実世界の政策環境において、全体のプログラム効果性にどのような影響を与えるか?
  • RQ2公平性と成果のトレードオフに対するステークホルダーの好みは、アルゴリズム意思決定においてどの程度の範囲で特定可能で、実装可能か?
  • RQ3予算制約下でユーティリティを最適化する結果主義的アプローチは、公平性と成果の有効性の両面で、従来の公平性制約を上回ることができるか?
  • RQ4歴史的成果が遅延している、もしくは部分的にしか観測されない状況において、最適な意思決定ポリシーを効率的にデータから学習できるか?
  • RQ5本手法が提案する学習アルゴリズムは、動的かつ現実世界の政策環境において、どのようなサンプル複雑性と収束性の性質を示すか?

主な発見

  • 結果主義的枠組みは、等しいグループ間の支出を保証する公理的公平性制約に比べ、全体的なサービス提供量の意図しない低下を回避することで、顕著に優れた性能を示す。
  • サンタクルサ郡の実際のクライアントデータを用いたシミュレーションにおいて、提案手法は、ベースライン手法と比較して、より高い裁判廷出廷率を達成しながら、支出の平等性を維持した。
  • 線形計画法を用いたUCBベースの学習アルゴリズムは、実証的評価において、ランダム割り当てやグリーディーポリシー学習よりも優れた性能を示した。
  • 中間の代理指標(例:予約確認)を用いることで、本手法は遅延した成果に対しても効果的に対応し、ポリシー更新を支援した。
  • サンプル複雑性の境界が導出され、わずかな正則性条件のもとで、アルゴリズムが高確率で近似的に最適なポリシーに収束することを示した。
  • アンケート結果から、ステークホルダーは、より高い支出の公平性を達成するために、裁判廷出廷率のわずかな低下を許容する意思があることが確認され、ユーティリティに基づく好みの特定手法の妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。