Skip to main content
QUICK REVIEW

[論文レビュー] Empirical observation of negligible fairness-accuracy trade-offs in machine learning for public policy

Kit T. Rodolfa, Hemank Lamba|arXiv (Cornell University)|Dec 5, 2020
Ethics and Social Impacts of AI参考文献 37被引用数 83
ひとこと要約

本論文は、公共政策分野における機械学習の公平性と精度のトレードオフを実証的に調査し、サブグループごとのスコアしきい値を用いた後処理による差別是正が、特に再現率において顕著な公平性の向上をもたらす一方で、トップ-k選択におけるモデルの精度を損なわずに実現できることを示している。4つの実世界の政策分野(精神保健、住宅の安全、教育、クラウドファンディング)において、公平性の向上がわずかな精度の損失で達成された。これは、公平性を実現するには複雑な手法やパフォーマンスの妥協を要するという仮定に反する。

ABSTRACT

Growing use of machine learning in policy and social impact settings have raised concerns for fairness implications, especially for racial minorities. These concerns have generated considerable interest among machine learning and artificial intelligence researchers, who have developed new methods and established theoretical bounds for improving fairness, focusing on the source data, regularization and model training, or post-hoc adjustments to model scores. However, little work has studied the practical trade-offs between fairness and accuracy in real-world settings to understand how these bounds and methods translate into policy choices and impact on society. Our empirical study fills this gap by investigating the impact of mitigating disparities on accuracy, focusing on the common context of using machine learning to inform benefit allocation in resource-constrained programs across education, mental health, criminal justice, and housing safety. Here we describe applied work in which we find fairness-accuracy trade-offs to be negligible in practice. In each setting studied, explicitly focusing on achieving equity and using our proposed post-hoc disparity mitigation methods, fairness was substantially improved without sacrificing accuracy. This observation was robust across policy contexts studied, scale of resources available for intervention, time, and relative size of the protected groups. These empirical results challenge a commonly held assumption that reducing disparities either requires accepting an appreciable drop in accuracy or the development of novel, complex methods, making reducing disparities in these applications more practical.

研究の動機と目的

  • 機械学習を公共政策に応用する実世界の応用において、公平性と精度のトレードオフが存在するかを調査すること。
  • リソース制約のある環境において、後処理による差別是正手法の公平性と精度に与える実用的影響を評価すること。
  • トップ-k干渉におけるモデルの精度を著しく損なわずに、公平性の向上を達成できるかを評価すること。
  • 多様な政策文脈、グループのサイズ、リソース水準において、公平性と精度の結果がどれほど頑健であるかを検討すること。

提案手法

  • 保護されたグループ間の再現率を均衡させるために、サブグループごとのスコアしきい値を用いた後処理による差別是正を適用した。
  • 公平性は再現率の差異(機会の平等)を指標として用い、精度の指標としてトップ-k内の精度を主な指標とした。
  • グループごとのスケーリング手法を用いて予測スコアを調整し、グループ内順位を保持しながら不均衡を是正した。
  • 各政策文脈において、多様な推定器(例:ランダムフォレスト、ロジスティック回帰)を用い、グリッドサーチによるモデル学習とハイパーパramータチューニングを実施した。
  • 妥当性を確保するため、時系列のバリデーションスプリットとブートストラップサンプルを用いて性能を評価した。
  • リソース制約(例:500人、1,000件のプロジェクト)に従い、トップ-kリストを抽出し、精度と再現率の差異を測定した。

実験結果

リサーチクエスチョン

  • RQ1実世界の公共政策分野における機械学習の応用において、公平性と精度のトレードオフは存在するか?
  • RQ2サブグループごとのしきい値を用いた後処理による是正は、トップ-k精度を劣化させることなく、公平性を顕著に向上させることができるか?
  • RQ3異なる政策分野および保護されたグループのサイズにおいて、公平性と精度の向上はどれほど頑健か?
  • RQ4訓練中に公平性を考慮したモデル選択は、後処理による調整よりも優れた結果をもたらすか?
  • RQ5単純でスケーラブルな手法は、複雑な再トレーニングやアーキテクチャの変更なしに、公平性の向上を達成できるか?

主な発見

  • 収監者精神保健の文脈では、トップ500の精度がわずか1.2パーセンテージポイント低下した一方で、再現率の差異は50%以上減少した。
  • 住宅の安全の文脈では、高所得地域に差異が有利に働く状況下でも、トップ100の精度が0.5%未満の低下で公平性の向上が達成された。
  • 教育クラウドファンディングでは、性別および人種のサブグループにおいて公平性が向上し、トップ1,000件のプロジェクトにおける精度に顕著な低下は認められなかった。
  • 学生の成果の文脈では、過去に取りこぼされていた年齢超過の学生が再現率の公平性を向上させたが、トップ10,000の精度はわずか0.8%低下したにとどまった。
  • 時系列バリデーションスプリットおよびブートストラップ再サンプリングの両方において、同様に一貫した公平性の向上と最小限の精度損失が確認された。
  • 訓練中に公平性を無視したが後処理しきい値を適用したモデル選択戦略が、公平性を訓練段階で優先した戦略とほぼ同等の性能を示し、後処理調整の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。