Skip to main content
QUICK REVIEW

[論文レビュー] Fair and Optimal Classification via Post-Processing

Ruicheng Xian, Lang Yin|arXiv (Cornell University)|Nov 3, 2022
Advanced Causal Inference Techniques被引用数 6
ひとこと要約

本稿では、多クラス・マルチグループ分類において、最小誤差率を Wasserstein バリオセントル問題として定式化することにより、最適なデモグラフィックパラメータの平等性を達成する後処理手法を提案する。最適輸送を用いて事前学習済みスコア関数から公平な分類器を導出し、公平性制約下での可能な限り低い誤差率を達成する。理論的保証とベンチマークデータセットにおける実証的検証を併せ持つ。

ABSTRACT

To mitigate the bias exhibited by machine learning models, fairness criteria can be integrated into the training process to ensure fair treatment across all demographics, but it often comes at the expense of model performance. Understanding such tradeoffs, therefore, underlies the design of fair algorithms. To this end, this paper provides a complete characterization of the inherent tradeoff of demographic parity on classification problems, under the most general multi-group, multi-class, and noisy setting. Specifically, we show that the minimum error rate achievable by randomized and attribute-aware fair classifiers is given by the optimal value of a Wasserstein-barycenter problem. On the practical side, our findings lead to a simple post-processing algorithm that derives fair classifiers from score functions, which yields the optimal fair classifier when the score is Bayes optimal. We provide suboptimality analysis and sample complexity for our algorithm, and demonstrate its effectiveness on benchmark datasets.

研究の動機と目的

  • 一般のマルチグループ・マルチクラス・ノイズあり設定における分類誤差とデモグラフィックパラメータの平等性の間の本質的トレードオフを特定すること。
  • デモグラフィックパラメータの平等性の下で、属性に依存するランダム化分類器が達成可能な最小誤差率を同定すること。
  • 事前学習済みスコア関数を用いて、最適な公平性・性能トレードオフを達成する実用的な後処理アルゴリズムを開発すること。
  • 提案手法のサンプル複雑度およびサブ最適性解析を提供すること。
  • ベンチマークデータセットを用いた実証的検証を通じて、公平性と精度のトレードオフを正確に制御できることを示すこと。

提案手法

  • デモグラフィックパラメータの平等性下での最小誤差率は、各グループごとのベイズ最適スコア関数の上での緩和された Wasserstein バリオセントル問題の最適値として特徴づけられる。
  • 最適な公平分類器は、バリオセントル解から得られる最適輸送マップとベイズ最適スコア関数の合成として構築される。
  • 任意の事前学習済みスコア関数を、デモグラフィックパラメータの平等性を強制するための線形計画法を用いて公平分類器に変換する後処理アルゴリズムが提案される。
  • 輸送マップの制約下での妥当な点を求めるために二次計画法が用いられ、マージンに基づく一般化性能が向上する。
  • 有限標本推定に適したアルゴリズムのインスタンス化と、理論的サンプル複雑度の境界が得られる。
  • ロジスティック回帰および BERT を用いたモデルを用いて、ACSIncome、BiasBios、Adult、Communities といった実世界のデータセットでアプローチが評価されている。

実験結果

リサーチクエスチョン

  • RQ1一般のマルチグループ・マルチクラス・ノイズあり設定下で、デモグラフィックパラメータの平等性を満たす条件下で達成可能な最小分類誤差は何か?
  • RQ2事前学習済みスコア関数から最適な公平分類器をどのように構築できるか?
  • RQ3この一般設定下での公平性と精度の理論的トレードオフは何か?
  • RQ4提案された後処理手法は、既存の公平分類アルゴリズムと比較して、性能およびサンプル効率の面でどのように異なるか?
  • RQ5提案されたアルゴリズムのサンプル複雑度およびサブ最適性は何か?

主な発見

  • デモグラフィックパラメータの平等性下での最小誤差率は、グループ固有の条件付き平均分布の Wasserstein-1 バリオセントル問題の最適値として与えられる。
  • 最適な公平分類器は、バリオセントル解から得られる最適輸送マップとベイズ最適スコア関数の合成である。
  • 提案された後処理手法は、入力スコア関数がベイズ最適である場合、理論的最小誤差率を達成する。
  • ベンチマークデータセットにおいて、本手法は公平性と精度のトレードオフを正確に制御でき、FairProjection などの既存手法と比較して同等の公平性制約下で精度が優れている。
  • アルゴリズムは効率的に動作し、大規模データセットにおいて CPU で後処理時間が 2 秒未満で実行可能であり、複数のランダムスプリットおよびモデルタイプにわたり高いロバスト性を示した。
  • 妥当な点の探索に二次計画法を用いることで、線形計画法に比べて誤差率とデモグラフィックパラメータの違反が両方とも低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。