Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Labeled and Unlabeled Data for Consistent Fair Binary Classification

Evgenii Chzhen, Christophe Denis|arXiv (Cornell University)|Jun 12, 2019
Ethics and Social Impacts of AI参考文献 4被引用数 18
ひとこと要約

本稿では、等しい機会の制約の下で公平な二値分類のための半教師ありプラグイン手法を提案する。ラベル付きデータを用いてクラス条件付き確率を推定し、ラベルなしデータを用いてグループ固有の意思決定しきい値をキャリブレーションする。この手法は統計的に一貫性があり、計算的にも効率的であり、ラベルなしデータから導かれるしきい値を再キャリブレーションすることで、最適な公平性と分類性能を達成する。

ABSTRACT

We study the problem of fair binary classification using the notion of Equal Opportunity. It requires the true positive rate to distribute equally across the sensitive groups. Within this setting we show that the fair optimal classifier is obtained by recalibrating the Bayes classifier by a group-dependent threshold. We provide a constructive expression for the threshold. This result motivates us to devise a plug-in classification procedure based on both unlabeled and labeled datasets. While the latter is used to learn the output conditional probability, the former is used for calibration. The overall procedure can be computed in polynomial time and it is shown to be statistically consistent both in terms of the classification error and fairness measure. Finally, we present numerical experiments which indicate that our method is often superior or competitive with the state-of-the-art methods on benchmark datasets.

研究の動機と目的

  • 等しい機会の公平性制約の下で、統計的に一貫性があり、計算的にも効率的な公平な二値分類のための手法を開発すること。
  • グループ依存のしきい値を備えたしきい値付きベイズ回帰器として最適な公平分類器の構成的表現を導出すること。
  • ラベル付きデータ(確率推定のため)とラベルなしデータ(しきい値キャリブレーションのため)を活用するプラグイン手法を提案すること。
  • この手法が、任意の市販の確率推定器と組み合わせて適用可能でありながら、公平性と分類精度を維持すること。

提案手法

  • 最適な公平分類器は、感受性グループ間で真正陽性率を均等化するように選ばれたしきい値を備えたベイズ回帰器のしきい値付きバージョンとして導出される。
  • 二段階的手順を提案する:まず、ラベル付きデータを用いて P(Y=1|X) の条件付き確率を推定する。次に、ラベルなしデータを用いてグループ固有のしきい値を推定する。
  • しきい値キャリブレーションは、多項式時間で解ける1変数最適化問題として定式化される。
  • やや弱い正則性仮定の下で、分類リスクおよび公平性指標の両方において、この手法が一貫性を示すことが示された。
  • このアプローチは汎用的であり、SVM やロジスティック回帰、ランダムフォレストなどの任意の一貫性のある確率推定器と組み合わせて使用可能である。
  • 双対性およびサドルポイント解析を用いて理論的整合性を確立し、最適な公平分類器への収束を示した。

実験結果

リサーチクエスチョン

  • RQ1等しい機会の公平性制約の下で、最適分類器の明示的表現は何か?
  • RQ2ラベル付きおよびラベルなしデータを併用する半教師あり手法は、公平性および分類性能の両面で統計的整合性を達成できるか?
  • RQ3ラベルなしデータのみを用いて、効率的かつ一貫性を持ってグループ依存のしきい値を推定する方法は何か?
  • RQ4ラベルなしデータを用いた公平分類における整合性を保証するための最小限の仮定は何か?
  • RQ5提案手法は、最先端の公平学習手法と比べて、実験的にどのように評価されるか?

主な発見

  • 最適な等しい機会分類器は、グループ依存のしきい値を備えたベイズ回帰器をしきい値処理することで得られ、本稿で明示的に導出されている。
  • 提案手法は統計的に一貫性がある:標本サイズが増加するにつれて、分類誤差および公平性指標がともに最適値に収束する。
  • COMPAS、Adult、German、Arrhythmia、Drug といったベンチマークデータセットにおいて、最先端手法と比較して優れた、または同等の性能を達成している。
  • 実験では、分散等しい機会(DEO)指標が顕著に低減された—例えば、Adult および German データセットでは DEO ≈ 0.02 を達成—、高精度を維持したまま。
  • ラベルなしデータに基づくキャリブレーションステップは計算的にも効率的であり、1変数最適化問題に還元される。
  • 感受性属性がモデルの関数形に含まれない場合でも、この手法は有効であることが示され、ロバストネスと一般化性能が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。