Skip to main content
QUICK REVIEW

[論文レビュー] It's COMPASlicated: The Messy Relationship between RAI Datasets and Algorithmic Fairness Benchmarks

Michelle Bao, Angela Zhou|arXiv (Cornell University)|Jun 10, 2021
Ethics and Social Impacts of AI参考文献 91被引用数 33
ひとこと要約

本論文は、前期RAIデータセット、特にCOMPASが偏っており、公正性のベンチマークには文脈的に不適合であると主張し、実世界の刑事司法結果はアルゴリズム的公正性を超えた社会技術的要因に依存すると指摘する。RAIを用いる際には、学際的な基準と規範意識を提唱する。

ABSTRACT

Risk assessment instrument (RAI) datasets, particularly ProPublica's COMPAS dataset, are commonly used in algorithmic fairness papers due to benchmarking practices of comparing algorithms on datasets used in prior work. In many cases, this data is used as a benchmark to demonstrate good performance without accounting for the complexities of criminal justice (CJ) processes. However, we show that pretrial RAI datasets can contain numerous measurement biases and errors, and due to disparities in discretion and deployment, algorithmic fairness applied to RAI datasets is limited in making claims about real-world outcomes. These reasons make the datasets a poor fit for benchmarking under assumptions of ground truth and real-world impact. Furthermore, conventional practices of simply replicating previous data experiments may implicitly inherit or edify normative positions without explicitly interrogating value-laden assumptions. Without context of how interdisciplinary fields have engaged in CJ research and context of how RAIs operate upstream and downstream, algorithmic fairness practices are misaligned for meaningful contribution in the context of CJ, and would benefit from transparent engagement with normative considerations and values related to fairness, justice, and equality. These factors prompt questions about whether benchmarks for intrinsically socio-technical systems like the CJ system can exist in a beneficial and ethical way.

研究の動機と目的

  • 前期RAIデータセットにおける偏りと誤差、およびそれらが公正性のベンチマークへ及ぼす影響を明らかにする。
  • アルゴリズム的公正性だけでは刑事司法の現実の公正を保証できない理由を説明する。
  • RAIを評価する際には、犯罪学・心理学・法学・倫理学の学際的基準を奨励する。
  • 刑事司法でRAIデータセットを用いる研究のための規範的考慮事項と実践的ガイドラインを提供する。

提案手法

  • Y(アウトカム)、A(保護属性)、X(共変量)および分布全体にわたるバイアスと誤差を調査する。
  • 刑事司法プロセスと裁量が、公正性ベンチマークを実世界のアウトカムに適用する際の限界となることを検討する。
  • 学際的な方法論基準と標準的なMLベンチマーク実践を比較する。
  • COMPAS/RAIデータの文脈的正当化を含む推奨事項とベストプラクティスを提供する。
  • AI公正性の実践とCJ研究規範の乖離を批判的に分析する。

実験結果

リサーチクエスチョン

  • RQ1前期RAIデータセットには、ベンチマークの妥当性を損なう偏りや測定誤差が含まれているのか。
  • RQ2刑事司法プロセスと人間の裁量は、アルゴリズム予測を超えて現実の公正さにどのように影響するのか。
  • RQ3RAIを研究する際、刑事司法(犯罪学、心理学、法学)の規範とMLベンチマーク規範はどう異なるのか。
  • RQ4公正性研究におけるRAIデータセットの使用を導くべき規範的配慮は何か。
  • RQ5CJ研究におけるCOMPASとRAIデータの有意義な活用を改善するベストプラクティスは何か。

主な発見

  • COMPASを含むRAIデータセットは、アウトカム、保護属性、共変量に跨る測定バイアスと誤差を含み、ベンチマークを複雑にする。
  • 分布的バイアス、選択効果、刑事司法プロセスにおける下流の裁量が、アルゴリズム公正性の結果を実世界のアウトカムへ移すことを制限する。
  • 従来のRAI実験を単に再現するだけでは、公正性の概念とCJの文脈を明示的に検討せずに、規範的立場を強化してしまう。
  • 学際的関与は、社会技術的CJシステムのベンチマークには、文脈・価値観・倫理的配慮が純粋な統計的公正性を超えて必要であることを示す。
  • 現在のML公表慣行とデータ中心のベンチマークはCJ研究の目的と整合せず、実世界の影響を過小評価・過大評価する可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。