Skip to main content
QUICK REVIEW

[論文レビュー] Capuchin: Causal Database Repair for Algorithmic Fairness

Babak Salimi, Luke Rodriguez|arXiv (Cornell University)|Feb 21, 2019
Ethics and Social Impacts of AI参考文献 49被引用数 14
ひとこと要約

Capuchinは、保護属性が結果に正当に影響を与える可能性がある許容可能な変数を同定することで、アルゴリズム的バイアスを軽減するための因果的データ修復フレームワークを提案する。その後、多値依存関係と最適化技術(行列分解、MaxSAT)を用いて訓練データを修復し、保証付きの公平性を実現する。実世界のデータセット(AdultやCOMPASなど)において、最先端の事前処理手法を上回る公平性と有用性を達成している。

ABSTRACT

Fairness is increasingly recognized as a critical component of machine learning systems. However, it is the underlying data on which these systems are trained that often reflect discrimination, suggesting a database repair problem. Existing treatments of fairness rely on statistical correlations that can be fooled by statistical anomalies, such as Simpson's paradox. Proposals for causality-based definitions of fairness can correctly model some of these situations, but they require specification of the underlying causal models. In this paper, we formalize the situation as a database repair problem, proving sufficient conditions for fair classifiers in terms of admissible variables as opposed to a complete causal model. We show that these conditions correctly capture subtle fairness violations. We then use these conditions as the basis for database repair algorithms that provide provable fairness guarantees about classifiers trained on their training labels. We evaluate our algorithms on real data, demonstrating improvement over the state of the art on multiple fairness metrics proposed in the literature while retaining high utility.

研究の動機と目的

  • 訓練データに埋め込まれた歴史的差別のによって生じる機械学習システムにおけるアルゴリズム的バイアスに対処すること。
  • シンプソンのパラドックスのような統計的異常によって欺かれる可能性がある関連性に基づく公平性指標の限界を克服すること。
  • 完全な因果モデルを必要とせず、因果的仮定に裏付けられたデータベース修復問題として公平性を形式化すること。
  • 下流の機械学習モデルに依存しない、効率的で保証付きの公平なデータ修復アルゴリズムを開発すること。
  • 実世界のデータセットにおいて、予測の有用性を維持しながら公平性指標を向上させること。

提案手法

  • 保護属性が結果に正当に影響を与える可能性がある許容可能な変数を用いて公平性を形式化することで、因果的公平性と誤った相関を区別する。
  • 公平性条件を飽和した条件付き独立性に翻訳し、データベース修復のために多値依存関係(MVD)として表現する。
  • 2つの修復アルゴリズムを開発する:1つはラベル分布の近似を目的とした低ランク行列分解に基づくもの、もう1つはMVD制約を最小限のラベル変更で満たすMaxSATに基づくもの。
  • 修復済みのデータを用いて分類器を学習させ、保護属性が予測に対する直接的な因果的影響を持たないようにする。
  • 公平性を、関連性に基づく指標(例:デモグラフィックパリティ、等しいオッズ)と因果的公平性指標の両方で評価し、耐性を検証する。
  • 実データセット(Adult、COMPAS)にフレームワークを適用し、最先端の事前処理手法と性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1因果構造に根ざした公平性の定義により、シンプソンのパラドックスのような関連性に基づく公平性指標の落とし穴を回避できるか?
  • RQ2完全な因果モデルを必要とせず、許容可能な変数に関する仮定に依存するだけで、どの程度公平性を強制できるか?
  • RQ3特に多値依存関係(MVD)を用いたデータベース修復技術が、訓練データから差別的因果的影響を体系的に除去するために有効か?
  • RQ4提案された修復アルゴリズムは、既存の事前処理手法と比較して、公平性と予測有用性の両面で優れているか?
  • RQ5修復済みのデータは、未知のテストデータに対しても一般化可能な公平な分類器を生成するか?

主な発見

  • Capuchinは、バイナリ化されたAdultおよびCOMPASデータセットの両方において、CalmonおよびFeldmanの事前処理手法よりもデータの有用性が顕著に優れていた。
  • バイナリ化されたAdultデータでは、Capuchinはベースライン手法よりも公平性違反(ROD)をより効果的に低減しながら、高い正確性を維持した。
  • バイナリ化が進んでいたCOMPASデータでは、Capuchinは他の手法が2%の正確性低下を引き起こしたのに対し、正確性を維持または向上させた。
  • CapuchinのMaxSATベースのアプローチは、バイナリ化されたデータではデータ密度が低いため性能が悪く、データの疎らさに敏感であることが明らかになった。
  • 一部のベースラインが単独でデモグラフィックパリティ(DP)を強制したが、これは特に大多数のグループに対する新たなサブグループバイアスを生じさせた。
  • フレームワークは、複数の指標にわたって一貫した公平性の向上を示し、未知のテストデータに対しても耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。