Skip to main content
QUICK REVIEW

[論文レビュー] Identifying Biased Subgroups in Ranking and Classification

Eliana Pastor, Luca de Alfaro|arXiv (Cornell University)|Aug 17, 2021
Imbalanced Data Classification Techniques参考文献 21被引用数 4
ひとこと要約

本論文では、分類およびランク付けシステムにおけるバイアスのありそうなデータサブグループを、グローバルモデルのパフォーマンスからの統計的乖離を測定することで自動的に検出する手法を提案する。頻出アイテムセットマイニングとシャープレイ値を用い、極端なFPR/FNRまたは利益格差を示すサブグループを同定し、各属性がバイアスにどの程度寄与しているかを定量化することで、感受性属性の事前知識がなくても的確な公平性監査を可能にする。

ABSTRACT

When analyzing the behavior of machine learning algorithms, it is important to identify specific data subgroups for which the considered algorithm shows different performance with respect to the entire dataset. The intervention of domain experts is normally required to identify relevant attributes that define these subgroups. We introduce the notion of divergence to measure this performance difference and we exploit it in the context of (i) classification models and (ii) ranking applications to automatically detect data subgroups showing a significant deviation in their behavior. Furthermore, we quantify the contribution of all attributes in the data subgroup to the divergent behavior by means of Shapley values, thus allowing the identification of the most impacting attributes.

研究の動機と目的

  • 機械学習モデルがグローバルデータセットと比べて顕著に異なるパフォーマンスを示すデータサブグループを特定する課題に対処すること。
  • 感受性属性や事前に定義された保護群を必要とせずに、バイアスのありそうなサブグループの検出を自動化すること。
  • シャープレイ値を用いて個々の属性がサブグループの乖離にどの程度寄与しているかを定量化し、実行可能なインサイトを得ること。
  • 分類とランク付けの両方のシナリオにこのアプローチを拡張し、多様な機械学習応用における公平性監査を可能にすること。

提案手法

  • グローバルデータセットとサブグループの間のパフォーマンス統計(例:FPR、FNR、利益)の差を測るための乖離指標を導入する。
  • 効率的なサブグループの発見のため、頻出アイテムセットマイニング(例:FP-growth)を用い、サポート閾値を超える属性値の組み合わせを特定する。
  • マイニング中に各アイテムセットの結果統計(例:平均利益、偽陽性率)を計算し、乖離を特定する。
  • シャープレイ値を適用して、アイテムセット全体の乖離を個々の属性値ごとの寄与度に分解する。
  • サブグループが十分に大きく統計的に意味のあるものであることを保証するため、サポート閾値を用いてフィルタリングを行う。
  • 利益を順位位置の関数(例:γ(i) = i^−0.1)としてモデル化することで、ランク付けシステムに対してもフレームワークを拡張し、順位ベースの結果に対する乖離分析を可能にする。

実験結果

リサーチクエスチョン

  • RQ1どのデータサブグループがグローバルモデルの動作と比べて顕著に異なるパフォーマンス(例:高いFPRやFNR)を示しているか?
  • RQ2事前に定義された感受性属性に依存せずに、こうしたサブグループを自動で検出する方法は何か?
  • RQ3特定のサブグループにおける観察された乖離に、どの個々の属性が最も寄与しているか?
  • RQ4ランク付けシナリオにおいて、モデルのパフォーマンスはサブグループごとにどのように変化するか、特に利益配分の観点から。

主な発見

  • COMPASデータセットにおいて、サブグループ{age<25, #prior>3, sex=Male}はFPRで59%の乖離を示し、偽陽性率が非常に高いことを示している。
  • サブグループ{age>45, charge=M, race=Cauc}はFNRで30%の乖離を示し、このデモグラフィックグループに対して偽陰性率が高いことを示唆している。
  • シャープレイ値分析により、{age<25, #prior>3, sex=Male}サブグループにおけるFPRの乖離に対して、age<25と#prior>3が主な寄与を示した一方、sex=Maleは軽微な役割にとどまった。
  • Law Schoolデータセットにおいて、アイテムセット{LSAT≤33.0, race=Black, sex=Male}はZFYA(1年次平均成績)の乖離が最小であり、負の結果においてrace=Blackが主な要因であった。
  • 本手法は、サポート閾値(s=0.005)を超えるすべての関連するアイテムセットを効率的に同定し、10^5個のアイテムセットであっても12秒未塔でその乖離を計算した。
  • 分析により、Law Schoolのインテリビューシップランク付けにおいて、レースが不平等な利益配分の主な要因であることが浮き彫りになり、さらなる調査の重要な分野であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。