Skip to main content
QUICK REVIEW

[論文レビュー] Achieving Fairness at No Utility Cost via Data Reweighing with Influence

Peizhao Li, Hongfu Liu|arXiv (Cornell University)|Feb 1, 2022
Ethics and Social Impacts of AI被引用数 6
ひとこと要約

本稿では、影響関数を用いて訓練データに細粒度で個別に重みを割り当てることで、予測性能を損なわずに公平性を向上させるデータ再重み付け手法を提案する。制約付き線形計画法により重みを最適化することで、ベースライン手法と比較して複数の表形式データセットにおいて、コストフリーの公平性を達成し、等しい機会を向上させつつ、性能を維持またはわずかに向上させる。

ABSTRACT

With the fast development of algorithmic governance, fairness has become a compulsory property for machine learning models to suppress unintentional discrimination. In this paper, we focus on the pre-processing aspect for achieving fairness, and propose a data reweighing approach that only adjusts the weight for samples in the training phase. Different from most previous reweighing methods which usually assign a uniform weight for each (sub)group, we granularly model the influence of each training sample with regard to fairness-related quantity and predictive utility, and compute individual weights based on influence under the constraints from both fairness and utility. Experimental results reveal that previous methods achieve fairness at a non-negligible cost of utility, while as a significant advantage, our approach can empirically release the tradeoff and obtain cost-free fairness for equal opportunity. We demonstrate the cost-free fairness through vanilla classifiers and standard training processes, compared to baseline methods on multiple real-world tabular datasets. Code available at https://github.com/brandeis-machine-learning/influence-fairness.

研究の動機と目的

  • アルゴリズム意思決定における持続的な公平性と性能のトレードオフを是正するため、訓練サンプルの再重み付けを行う。
  • モデルアーキテクチャや学習手順を変更せずに、データバイアスを是正する前処理手法を開発する。
  • 個別サンプルの影響推定を用いて、性能を低下させることなく公平性を向上させる「コストフリーの公平性」を実現する。
  • 既存の機械学習パイプラインや標準的な分類器と互換性がある、実用的で即時適用可能なソリューションを提供する。

提案手法

  • 本手法は、影響関数を用いて各サンプルが公平性および性能に与える影響を推定し、完全な再訓練なしに訓練サンプルを1つ削除した際の影響を推定する。
  • 公平性(例:等しい機会)と性能(例:予測精度)の制約のもとで、最適な再重み付けを求める線形計画問題を定式化する。
  • 一般化を確保するため、影響は検証セット上で測定され、標準的な学習の前段階で1回のパスで再重み付けが実行される。
  • 誤標識または不公正に影響を与えるサンプルは軽減され、高品質なサンプルは保持され、性能の損失が最小限に抑えられる。
  • 複数のサンプルを同時に削除する際の影響推定誤差を是正するためのハイパーパrameterが導入され、ロバストネスが向上する。
  • 本手法は、標準的な分類器と標準的な学習プロセスを用いて、実世界の表形式データセットで評価される。

実験結果

リサーチクエスチョン

  • RQ1機械学習モデルにおいて、性能コストを伴わずに公平性を向上させることは可能か?
  • RQ2グループ単位の均一な重み付けと比較して、個別サンプルの影響推定はより精細な再重み付けを可能にするか?
  • RQ3性能を維持または向上させながら公平性を向上させる再重み付け戦略は存在するか?
  • RQ4影響関数は、サンプル削除による実際のモデル変化をどれほど正確に予測できるか?
  • RQ5前処理手法として、多様な実世界のデータセットにおいてコストフリーの公平性を達成できるか?

主な発見

  • 提案手法は、大多数のデータセットで性能コストを伴わず公平性を向上させ、従来の公平性と性能のトレードオフを実証的に解消する。
  • ベースライン手法とは異なり、性能を低下させることで公平性を向上させる傾向があるが、本手法は公平性を向上させつつ、性能を維持またはわずかに向上させる。
  • 影響関数は、1サンプルを除いた再訓練後の実際のモデル変化を高精度に予測しており、ほとんどの場合でピアソン相関係数(rho > 0.8)が高く維持される。
  • ヒューリスティック法、学習ベース手法、敵対的再重み付けベースラインと比較して、複数のデータセットにおいて本手法は公平性と性能の安定性の両面で優れている。
  • ベースレートの差が大きいケースで性能がわずかに低下する場合でも、公平性の向上は顕著であり、ロバストネスが示された。
  • 異なるモデルやデータセット(例:AdultやCompas)においても本手法は有効であり、標準的な学習パイプラインと互換性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。