Skip to main content
QUICK REVIEW

[論文レビュー] Fairness without Imputation: A Decision Tree Approach for Fair Prediction with Missing Values

Haewon Jeong, Hao Wang|arXiv (Cornell University)|Sep 21, 2021
Ethics and Social Impacts of AI被引用数 6
ひとこと要約

本稿では、欠損値を明示的なデータ補完なしに、欠損を属性として組み込む(MIA)手法と混合整数プログラミング(MIP)を用いて欠損値を処理しながら公平性と精度を同時に最適化する統合的決定木アプローチ、Fair MIP Forestを提案する。実世界のデータセットにおいて、補完済みデータ上で訓練された公平性に配慮したモデルよりも優れた性能を示し、グループごとの欠損パターンの違いがある場合、分離された補完と公平性補正が偏った結果をもたらすことを示している。

ABSTRACT

We investigate the fairness concerns of training a machine learning model using data with missing values. Even though there are a number of fairness intervention methods in the literature, most of them require a complete training set as input. In practice, data can have missing values, and data missing patterns can depend on group attributes (e.g. gender or race). Simply applying off-the-shelf fair learning algorithms to an imputed dataset may lead to an unfair model. In this paper, we first theoretically analyze different sources of discrimination risks when training with an imputed dataset. Then, we propose an integrated approach based on decision trees that does not require a separate process of imputation and learning. Instead, we train a tree with missing incorporated as attribute (MIA), which does not require explicit imputation, and we optimize a fairness-regularized objective function. We demonstrate that our approach outperforms existing fairness intervention methods applied to an imputed dataset, through several experiments on real-world datasets.

研究の動機と目的

  • 標準的な公平性アルゴリズムを補完済みデータに適用した場合、社会的・文化的背景グループごとに欠損パターンが異なる状況でも、公平性が維持されるかどうかを調査すること。
  • データ補完後に公平性干渉を適用する一般的な手法における、3つの明確な差別のリスク要因を同定・分析すること。
  • 明示的な補完なしに、公平性と精度を同時に最適化するエンドツーエンドの手法を開発し、グループ依存の欠損パターン下でも公平性を保持すること。
  • 実験を通じて、提案手法が、補完済みデータに適用された既存の公平性アルゴリズムよりも、公平性と精度のトレードオフをより良く達成できることを示すこと。

提案手法

  • 本手法は、欠損値を決定木の分割における別個のカテゴリとして扱う「欠損を属性として組み込む(MIA)」手法を用い、明示的な補完の必要を排除する。
  • 学習目的関数を、公平性正則化項を含む混合整数プログラミング(MIP)として定式化し、モデルの精度と公平性を同時に最適化する。
  • アルゴリズムは公平性制約を木の構築プロセスに直接統合し、予測性能と並行して公平性を最適化することを保証する。
  • 一般化性能の向上とトレーニング時間の短縮を図るため、公平な木のアンサンブル(Fair MIP Forest)を用いる。
  • 精度と公平性のバランスを調整するための公平性正則化パラメータ(λ)を、異なるデータセットで異なる値をテストすることでチューニングする。
  • 本手法は、HSLS、COMPAS、Adultの3つの実世界データセットで評価され、グループ依存の欠損パターンを反映するように意図的に人工的に欠損値を挿入した。

実験結果

リサーチクエスチョン

  • RQ1社会的・文化的背景グループ間で欠損パターンが異なる状況において、補完済みデータに公平性アルゴリズムを適用しても、公平性が保たれるか?
  • RQ2分離された補完と公平性補正パイプラインを用いる場合の、主な3つの差別のリスク要因は何か?
  • RQ3欠損データと公平性を同時に処理する統合フレームワークは、標準的な二段階アプローチ(補完してから是正)を上回る性能を発揮できるか?
  • RQ4異なる下流学習タスクにおいて、普遍的に公平な補完手法を作成することは根本的に不可能であるか?
  • RQ5グループ依存の欠損パターンを有するデータセットにおいて、提案されたFair MIP Forest手法は、既存の公平性アルゴリズムと比較して、公平性と精度のトレードオフにおいて優れているか?

主な発見

  • 本研究では、二段階の補完・公平性パイプラインにおける差別のリスクの3つの主要要因を同定した:グループ間での補完バイアス、トレーニング時と推論時の補完の一貫性の欠如、普遍的に公平な補完手法の不可能性。
  • Fair MIP Forestは、HSLS、COMPAS、Adultの各データセットにおいて、補完済みデータに適用された公平性アルゴリズムよりも優れた公平性と精度のトレードオフを達成した。
  • HSLSデータセットでは、白人学生と代表が不足しているマイノリティ(URM)学生の間で、二次的ケアの教育水準や大学進学計画といった変数において、予測結果の公平性格差が低減された。
  • 高い欠損率下でも、高い精度を維持しながら、顔ぶれごとの偽陽性率および偽陰性率の格差を顕著に低減した。
  • 深さ3の木30本のアンサンブルで、1木あたり60秒の時間制限を設けた場合、全データセットで性能と計算コストの最良のバランスが達成された。
  • 公平性正則化付きMIP定式化は、公平性と精度のバランスをうまく調整でき、最適なλ値はそれぞれHSLSで0.1、COMPASで1.0、Adultで3.0であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。