Skip to main content
QUICK REVIEW

[論文レビュー] Hunting for Discriminatory Proxies in Linear Regression Models

Samuel Yeom, Anupam Datta|arXiv (Cornell University)|Oct 16, 2018
Corruption and Economic Development被引用数 15
ひとこと要約

本論文は、線形回帰モデルにおけるプロキシ使用の形式的定義を提示する。プロキシとは、保護属性と統計的に相関し、かつ因果的に影響を及ぼす入力変数の組み合わせである。著者らは、2次錐計画法(SOCP)を解くことで効率的な凸最適化手法を提案し、これを正当な免責事項に対応できるように拡張。実際の予測警察活動データセットにおいて、差別的パターンを特定する有効性を示した。

ABSTRACT

A machine learning model may exhibit discrimination when used to make decisions involving people. One potential cause for such outcomes is that the model uses a statistical proxy for a protected demographic attribute. In this paper we formulate a definition of proxy use for the setting of linear regression and present algorithms for detecting proxies. Our definition follows recent work on proxies in classification models, and characterizes a model's constituent behavior that: 1) correlates closely with a protected random variable, and 2) is causally influential in the overall behavior of the model. We show that proxies in linear regression models can be efficiently identified by solving a second-order cone program, and further extend this result to account for situations where the use of a certain input variable is justified as a `business necessity'. Finally, we present empirical results on two law enforcement datasets that exhibit varying degrees of racial disparity in prediction outcomes, demonstrating that proxies shed useful light on the causes of discriminatory behavior in models.

研究の動機と目的

  • 保護属性と相関し、モデル出力に影響を与える特徴量の組み合わせ(プロキシ)の概念を線形回帰モデルに形式的に定式化すること。
  • 特に2次錐計画法(SOCP)を用いた凸最適化により、このようなプロキシを効率的かつスケーラブルに検出するアルゴリズムを開発すること。
  • 特定の変数が保護属性と相関していても正当な理由(業務上の必要性)がある場合を考慮し、検出手法を拡張すること。
  • 実世界の予測警察活動データセットを用いて、本手法の差別的結果の根本原因を同定する能力を実証的に評価すること。
  • 機械学習モデルにおけるプロキシに基づく差別を監査するための実用的で計算的に実行可能なフレームワークを提供すること。

提案手法

  • プロキシを、保護属性と高い統計的関連性を示し、かつモデル出力に顕著な因果的影響を及ぼす入力変数の線形結合として定義する。
  • プロキシ検出を2次錐計画法(SOCP)として定式化し、凸最適化による効率的かつ正確なプロキシ計算を可能にする。
  • KKT行列が特異になる場合の緩和技術を導入し、制御された偽陽性率を保証する近似検出を可能にする。
  • 除外すべき変数(免責対象変数)に基づくプロキシを検出から除外するように最適化フレームワークを変更し、正当な相関が誤検出を引き起こさないよう保証する。
  • 因果的影響の尺度として、モデル出力に対するプロキシの分散の比を定義し、その差別的影響の潜在的強度を測定する。
  • 2つの予測警察活動データセットにアルゴリズムを適用し、個々の特徴量の相関とモデル出力との比較を通じてプロキシの強度を評価する。

実験結果

リサーチクエスチョン

  • RQ1分類問題から線形回帰モデルへのプロキシ使用の形式的定義を意味的に拡張可能か?
  • RQ2凸最適化技術(特に2次錐計画法)を用いて、線形回帰モデルにおけるプロキシを効率的に検出可能か?
  • RQ3保護属性と相関するが正当な理由で使用される変数を考慮するには、検出アルゴリズムをどのように適合できるか?
  • RQ4同定されたプロキシは、実世界の予測警察活動モデルにおける差別的影響の根本原因をどの程度説明できるか?
  • RQ5個々の特徴量の相関と合成プロキシとの間には、差別的影響の観点でどのような関係があるか?

主な発見

  • 正確なSOCPソルバが収束する限り、本手法は偽陽性なしにプロキシを検出でき、差別的行動の信頼性ある同定を可能にする。
  • C&Cデータセットでは、58個の変数から構成されるプロキシが影響度0.34(ε = 0.85)を示し、個々の特徴量の影響度を著しく上回った。
  • あるデータセットでは、非免責のプロキシの最大影響度は、一般のプロキシの最大影響度よりも著しく低く、1つの免責変数が差別的効果の大部分を説明していることが示された。
  • モデル全体で相殺効果が生じるため、完全なモデルでは顕著でないが、影響度がモデルの分散の14.5倍に達するプロキシが存在することを示した。
  • 近似検出アルゴリズムは偽陰性がないが、δが真の最大影響度を超えると偽陽性が生じる可能性があり、感度と正確性のトレードオフが顕在化している。
  • 実証的結果から、アルゴリズムは高速に実行され、モデルの最も問題の大きい要因を正確に同定でき、差別的影響の原因に関する実用的で行動可能な知見を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。