Skip to main content
QUICK REVIEW

[論文レビュー] Wasserstein Robust Classification with Fairness Constraints

Yijie Wang, Viet Anh Nguyen|arXiv (Cornell University)|Mar 11, 2021
Health Systems, Economic Evaluations, Quality of Life参考文献 22被引用数 5
ひとこと要約

本稿では、経験分布を中心とするタイプ-∞ Wasserstein 不確実性集合を用いて、分布的に頑健な分類フレームワークを提案する。このフレームワークは、等しい機会(EO)基準を用いて公平性を強制し、混合整数計画問題としての保守的再定式化を導出する。さらに、スケーラブルなヘッジ損失に基づく凸モデルを提案し、複数のデータセットにおいて最小限の精度損失で改善された公平性を達成する。

ABSTRACT

We propose a distributionally robust classification model with a fairness constraint that encourages the classifier to be fair in view of the equality of opportunity criterion. We use a type-$\infty$ Wasserstein ambiguity set centered at the empirical distribution to model distributional uncertainty and derive a conservative reformulation for the worst-case equal opportunity unfairness measure. We establish that the model is equivalent to a mixed binary optimization problem, which can be solved by standard off-the-shelf solvers. To improve scalability, we further propose a convex, hinge-loss-based model for large problem instances whose reformulation does not incur any binary variables. Moreover, we also consider the distributionally robust learning problem with a generic ground transportation cost to hedge against the uncertainties in the label and sensitive attribute. Finally, we numerically demonstrate that our proposed approaches improve fairness with negligible loss of predictive accuracy.

研究の動機と目的

  • 機械学習におけるアルゴリズムバイアスを是正するため、分布的に頑健な分類に公平性制約を統合すること。
  • 経験分布の周囲に分布的不確実性をモデル化するため、タイプ-∞ Wasserstein 不確実性集合を用いること。
  • 感受性グループ間の真陽性率が等しくなるように、等しい機会基準を用いて公平性を強制すること。
  • 分布的不確実性下での最悪ケースEO不公平度の保守的かつ取り扱いやすい再定式化を導出すること。
  • バイナリ変数を避けることで、大規模データセットに対するスケーラビリティを向上させる凸、ヘッジ損失に基づく近似を構築すること。

提案手法

  • 経験データ分布の周囲に分布的不確実性をモデル化するため、タイプ-∞ Wasserstein 不確実性集合を用いる。
  • 双対性理論を用いて、最悪ケースEO不公平度の保守的再定式化を導出する。
  • 中程度のスケールの問題に対して正確な解を得るため、混合整数線形計画問題(MILP)としての頑健な公平性問題を再定式化する。
  • バイナリ変数を回避し、大規模インスタンスにおけるスケーラビリティを向上させるために、凸でヘッジ損失に基づく近似を提案する。
  • ラベルおよび感受性属性の不確実性に対抗するため、一般的な地面輸送コストを統合する。
  • MILPには市販のソルバを、凸近似には勾配ベースの手法を用い、実用的導入を可能にする。
(a) $\varepsilon$ -DRFC
(a) $\varepsilon$ -DRFC

実験結果

リサーチクエスチョン

  • RQ1分布的不確実性下でも、分布的に頑健な分類モデルが公平性を効果的に強制できるか?
  • RQ2Wasserstein 不確実性下で、最悪ケースの等しい機会の不公平度をどのように保守的に再定式化できるか?
  • RQ3頑健な公平分類において、公平性、精度、計算効率のトレードオフは何か?
  • RQ4凸でヘッジ損失に基づく再定式化は、大規模データセットにスケーリング可能でありながら、高い公平性と精度を維持できるか?
  • RQ5提案手法は、最先端の公平性指向モデルと比較して、公平性および予測性能の面で優れているか?

主な発見

  • 提案手法は、テストされたすべてのデータセットで予測精度の損失を最小限に抑えながら、顕著な公平性の向上を達成する。
  • タイプ-∞ Wasserstein 不確実性集合は、タイプ-1と比較してよりスケーラブルな円錐再定式化を可能にし、統計的保証を維持する。
  • 混合整数計画法による再定式化により、EO不公平度の明示的バウンディングが可能となり、強い公平性保証が得られる。
  • ヘッジ損失に基づく凸モデル(HDRFC)は、1000件のサンプルでさえもすべてのデータセットで1秒未塔で解ける。DRFLR や ε-DRFC よりも実行時間が優れている。
  • Adult、Drug、COMPAS、および合成データセットにおいて、HDRFCモデルはDO+ や DRFLR よりも公平性-精度トレードオフの面で一貫して優れている。
  • Arrhythmia データセット(N=452)では、HDRFC と DO+ は0.2秒未塔で解けるが、ε-DRFC はN=1000で10分以上を要する。
(b) HDRFC
(b) HDRFC

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。