Skip to main content
QUICK REVIEW

[論文レビュー] Two-stage Algorithm for Fairness-aware Machine Learning

Junpei Komiyama, Hajime Shimao|arXiv (Cornell University)|Oct 13, 2017
Ethics and Social Impacts of AI参考文献 10被引用数 14
ひとこと要約

本稿では、感応属性から予測を分離するためのインストルメンタル変数に類似した前処理を用いることで、分類および回帰の両タスクにおいて差別の的影響を軽減する、2段階のアルゴリズム(2SDR)を提案する。この手法は、合成データおよび実世界のデータセットにおいて80%-ルールを満たす公平性を達成しており、数値的(連続的)な感応属性と説明変数をサポートする。既存の手法に比べて柔軟性と公平性適合性に優れている。

ABSTRACT

Algorithmic decision making process now affects many aspects of our lives. Standard tools for machine learning, such as classification and regression, are subject to the bias in data, and thus direct application of such off-the-shelf tools could lead to a specific group being unfairly discriminated. Removing sensitive attributes of data does not solve this problem because a extit{disparate impact} can arise when non-sensitive attributes and sensitive attributes are correlated. Here, we study a fair machine learning algorithm that avoids such a disparate impact when making a decision. Inspired by the two-stage least squares method that is widely used in the field of economics, we propose a two-stage algorithm that removes bias in the training data. The proposed algorithm is conceptually simple. Unlike most of existing fair algorithms that are designed for classification tasks, the proposed method is able to (i) deal with regression tasks, (ii) combine explanatory attributes to remove reverse discrimination, and (iii) deal with numerical sensitive attributes. The performance and fairness of the proposed algorithm are evaluated in simulations with synthetic and real-world datasets.

研究の動機と目的

  • 感応属性が非感応特徴と相関している場合に、アルゴリズム意思決定における差別的影響を是正すること。
  • 分類タスクに特化した既存手法とは異なり、分類および回帰の両方のタスクに適応する公平な機械学習手法を開発すること。
  • 実世界の応用で一般的な年齢などの数値的(連続的)な感応属性を扱えるようにすること。
  • 作業時間などの説明変数を組み込むことで、逆差別を防ぎつつ公平性を維持すること。
  • データ前処理とエンドツーエンドの公平学習の間にある方法を設計し、変換を最小限に抑えつつ公平性を保証すること。

提案手法

  • アルゴリズムは、計量経済学における2段階最小二乗法(2SLS)にインspiredされた2段階アプローチを採用する。
  • 第1段階では、目的変数を感応属性で回帰し、感応属性と相関のない残差を抽出する。
  • 第2段階では、第1段階の残差を用いて、説明変数を用いて結果を予測する線形モデル(例:リッジ回帰またはロジスティック回帰)を訓練する。
  • この手法により、最終的な予測が感応属性と相関しない(定理1および定理2)ことが保証され、差別的影響が軽減される。
  • 数値的感応属性をサポートでき、第2段階で一般化線形モデルを組み合わせられる。
  • 非二値の属性に対しては、相関を低減するために順序変換(分位数ベース)を適用するが、若干の精度低下を引き起こす。

実験結果

リサーチクエスチョン

  • RQ12段階のアルゴリズムは、分類および回帰の両タスクにおいて差別的影響を効果的に軽減できるか?
  • RQ2感応属性が数値的(例:年齢)である場合、分類タスクにおける性能はどのようになるか?
  • RQ3説明変数の組み込みにより、逆差別を防ぎつつ公平性を維持できるか?
  • RQ42段階設計は、既存の前処理および後処理の公平性手法に比べ、公平性および精度の面で優れているか?
  • RQ5第2段階で非線形モデルを使用した場合、公平性および性能にどのような影響を与えるか?

主な発見

  • 2SDRアルゴリズムは、AdultおよびC&Cデータセットの両方で複数の評価指標において80%-ルールを満たした。
  • Adultデータセットでは、順序変換を施さない分類タスクにおいて、2SDRはp%-ルールを0.83まで達成し、80%の閾値を上回った。
  • C&Cデータセットにおける回帰タスクでは、2SDRが平均偏差(MD)を0.02、RMSEを0.18まで低下させ、優れた公平性と性能を示した。
  • 第2段階でロジスティック回帰を用いた場合、Adultデータセットではp%-ルールが0.72まで低下し、非線形モデルがバイアスを再導入する可能性があることを示した。
  • 順序変換により、精度はわずかに低下した(例:2SDRでは0.82対0.83)、が、属性と感応変数の相関を低減させることで公平性が向上した。
  • 非線形第2段階モデル(例:SVM、GBM)は線形モデルに比べて著しく悪い公平性を示し、予測の非相関性を維持するには線形性が重要であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。