Skip to main content
QUICK REVIEW

[論文レビュー] Metrics and methods for a systematic comparison of fairness-aware machine learning algorithms

Gareth Jones, James M. Hickey|arXiv (Cornell University)|Oct 8, 2020
Ethics and Social Impacts of AI被引用数 7
ひとこと要約

本稿は、公平性と性能のトレードオフを統一的に定量化する新しい指標「フェア効率性(fair efficiency)」を用いて、公平性に配慮した機械学習アルゴリズムを体系的に比較するフレームワークを提案する。7つのデータセットで28のモデリングパイプラインを評価し、公平性に配慮した手法が顕著な性能低下を伴わずに公平性を達成できることを示している。一方で、データセット固有の特性がアルゴリズムの有効性に顕著な影響を及ぼすことが明らかになった。

ABSTRACT

Understanding and removing bias from the decisions made by machine learning models is essential to avoid discrimination against unprivileged groups. Despite recent progress in algorithmic fairness, there is still no clear answer as to which bias-mitigation approaches are most effective. Evaluation strategies are typically use-case specific, rely on data with unclear bias, and employ a fixed policy to convert model outputs to decision outcomes. To address these problems, we performed a systematic comparison of a number of popular fairness algorithms applicable to supervised classification. Our study is the most comprehensive of its kind. It utilizes three real and four synthetic datasets, and two different ways of converting model outputs to decisions. It considers fairness, predictive-performance, calibration quality, and speed of 28 different modelling pipelines, corresponding to both fairness-unaware and fairness-aware algorithms. We found that fairness-unaware algorithms typically fail to produce adequately fair models and that the simplest algorithms are not necessarily the fairest ones. We also found that fairness-aware algorithms can induce fairness without material drops in predictive power. Finally, we found that dataset idiosyncracies (e.g., degree of intrinsic unfairness, nature of correlations) do affect the performance of fairness-aware approaches. Our results allow the practitioner to narrow down the approach(es) they would like to adopt without having to know in advance their fairness requirements.

研究の動機と目的

  • 多様な用途における公平性に配慮した機械学習アルゴリズムの評価に標準化された体系的アプローチが不足しているという問題に対処すること。
  • 教師あり二値分類において、公平性と予測性能のバランスを最適化するのに最も効果的な公平性干渉手法を同定すること。
  • 意思決定のしきい値ポリシーに依存しない公平性干渉手法の直接比較を可能にする新しい指標「フェア効率性(fair efficiency)」の開発および検証すること。
  • データ固有の特性(例:内在的な不公平性、特徴量間の相関)が公平性に配慮したアルゴリズムの性能に与える影響を評価すること。
  • 新規の公平性誘導型特徴選択法「フェア特徴選択(Fair Feature Selection)」を導入し、比較のためのベースラインとしての有効性を検証すること。

提案手法

  • 意思決定のしきい値ポリシーに依存しないように正規化された、公平性と予測性能の比として定義される新しい指標「フェア効率性(fair efficiency)」を提案する。
  • 3つの実データセットおよび4つの合成データセットを用いた包括的な実験設定を採用。7つの公平性に配慮しないベースラインモデルと、8つの干渉タイプにわたる20の公平性に配慮したモデルを評価する。
  • モデル出力を意思決定に変換するための2つの異なる意思決定ポリシーを適用し、公平性評価におけるポリシー感受性の分析を可能にする。
  • フェア特徴選択のための特徴量ランク付けに、相互情報量、F検定スコア、ランダムフォレストの重要度増分の重み付き組み合わせを用いる。
  • 訓練中における制約(例:敵対的学習、制約付き最適化、正則化)、事後処理、前処理の手法を統合して公平性制約を適用する。
  • すべてのパイプラインの評価に、標準的な予測性能指標(例:AUC、正答率)および公平性指標(例:等しい機会、特徴量の平等性)を用いる。

実験結果

リサーチクエスチョン

  • RQ1多様なデータセットにおいて、公平性と予測性能のトレードオフを最も効果的にバランスさせる公平性に配慮した機械学習アルゴリズムはどれか?
  • RQ2異なる意思決定のしきい値ポリシーが公平性干渉の評価に与える影響は何か?また、統一された指標はこのばらつきを緩和できるか?
  • RQ3データセット固有の性質(例:内在的な不公平の度合い、特徴量間の相関構造)が、公平性干渉の有効性にどの程度影響を与えるか?
  • RQ4フェア特徴選択のような単純で解釈可能な手法は、より複雑な訓練時アプローチと同等の性能を達成できるか?
  • RQ5公平性に配慮したモデルは、公平性に配慮しないベースラインモデルと比べて、キャリブレーション性能および予測力において優れているか?

主な発見

  • 公平性に配慮しないモデルは、既知のバイアスを持つデータで学習した場合でさえ、十分な公平性を達成できないことが一貫して示された。
  • 最も単純な公平性に配慮したアルゴリズムが必ずしも最も公平ではない。性能はデータセットの特性やアルゴリズム設計に大きく依存する。
  • 公平性に配慮したアルゴリズムは、予測性能の著しい低下を伴わずに公平性を達成でき、フェア効率性が信頼性の高い比較指標として機能することが示された。
  • ラグランジュ還元に基づく2つの手法(LagRed BT および LagRed LR)は、ほとんどのデータセットで性能が低く、特にタイタニックデータセットでは公平性要件を満たせなかった。
  • フェア特徴選択は、より複雑な前処理および訓練時手法と同等の性能を達成しており、一部のケースではそれらを上回る公平性と性能のトレードオフを実現した。
  • データセット固有の特徴(例:相関の性質、内在的な不公平の度合い)が、公平性干渉の有効性に顕著な影響を与えることが判明し、あらゆる状況で優位な手法が存在しないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。