Skip to main content
QUICK REVIEW

[論文レビュー] Fair prediction with disparate impact: A study of bias in recidivism prediction instruments

Alexandra Chouldechova|arXiv (Cornell University)|Oct 24, 2016
Regulation and Compliance Studies被引用数 18
ひとこと要約

この論文は、予測バイアスが存在しない場合でも、人種ごとの再犯率の違いにより、再犯予測機器(RPI)が差別の的影響をもたらす可能性があることを示している。良好にキャリブレーションされたRPI、例えばCOMPASですら、Black被告に対して高い偽陽性率を生じさせ、2値罰則政策下では不均等な投獄結果をもたらす可能性がある。

ABSTRACT

Recidivism prediction instruments provide decision makers with an assessment of the likelihood that a criminal defendant will reoffend at a future point in time. While such instruments are gaining increasing popularity across the country, their use is attracting tremendous controversy. Much of the controversy concerns potential discriminatory bias in the risk assessments that are produced. This paper discusses a fairness criterion originating in the field of educational and psychological testing that has recently been applied to assess the fairness of recidivism prediction instruments. We demonstrate how adherence to the criterion may lead to considerable disparate impact when recidivism prevalence differs across groups.

研究の動機と目的

  • 心理的尺度テストにおける公平性基準が、再犯予測における現実世界の結果とどのように相互作用するかを調査すること。
  • 良好にキャリブレーションされたRPIが人種グループ間で差別的影響をもたらす条件を検討すること。
  • テストの公平性、誤差率、政策結果の間の統計的関連を明確にすること。
  • グループ間の誤差率をバランスさせることで、より細かいサブグループレベルでの不平等な結果を回避できるかどうかを評価すること。
  • ヘッドラインを惹くバイアス報告のため、データドリブンなリスク評価を放棄すべきではないと主張し、文脈に配慮した公平性評価を提唱すること。

提案手法

  • 人種(Black/White)、デシルスコア、2年以内の再犯結果を含むブラウアード郡COMPASデータセットを使用する。
  • 良好なキャリブレーションを基準としてテストの公平性を定義する:すべてのスコア値sについて、P(Y=1|S=s, R=r)が人種グループ間で等しい。
  • 閾値s_HRに基づき、粗粒化されたリスクスコアS_cを導入し、高リスク(HR)または低リスク(LR)に分類する。
  • 公平性制約下で、人種グループごとの誤差率(FPR、FNR)および陽性予測値(PPV)を分析する。
  • 2値罰則政策をモデル化し、高リスク者に投獄(t_H=1)が課せられることを想定し、予想される投獄確率をE[T] = P(T≠0)として導出する。
  • 全変動距離d_TV(f_b,y, f_w,y)を用いて差別的影響Δの上限を確立し、Δ ≤ (t_H - t_L) * d_TVを示す。

実験結果

リサーチクエスチョン

  • RQ1グループ固有の再犯有病率が、良好にキャリブレーションされたRPIとどのように作用し、差別的影響を生じるか。
  • RQ2COMPASのような良好にキャリブレーションされたRPIにおいて、人種グループ間で偽陽性率と偽陰性率がどの程度異なるか。
  • RQ3キャリブレーションに基づく公平性基準ですら、2値罰則政策下で不均等な処遇結果をもたらす可能性があるか。
  • RQ4グループ間の全体的な誤差率をバランスさせることは、より細かいサブグループの粒度レベルでの公平性を保証するのに十分か。
  • RQ5統計的効果量指標(例:d_TV)と差別的影響の大きさの関係は何か。

主な発見

  • 予測バイアスが存在しない(良好にキャリブレーションされている)にもかかわらず、Black被告の偽陽性率(FPR_b ≈ 0.45)はWhite被告のそれ(FPR_w ≈ 0.25)よりも高い。これは再犯有病率の違いに起因する。
  • 偽陽性率の差が、2値罰則政策下で、再犯しないBlack被告がWhite被告よりも1.8倍の確率で投獄される結果をもたらす。
  • 前科記録が少ないサブグループ(例:軽犯罪犯)においても、Black被告とWhite被告の間で偽陽性率の有意な差が依然として存在する。
  • Black被告とWhite被告のスコア分布間の全変動距離(d_TV = 24.5%)は、差別的影響の大きさの鋭い上限を提供する。
  • COMPASスコア分布のCohen’s dは0.60であり、中程度の効果量を示すが、スコアの正規性の欠如により、従来のオーバーラップ測定の有効性が制限される。
  • 本研究は、全体の誤差率をバランスさせることで、より細かいサブグループレベル(例:前科件数別)での差が完全に解消されないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。