Skip to main content
QUICK REVIEW

[論文レビュー] Certifying Some Distributional Fairness with Subpopulation Decomposition

Mintong Kang, Linyi Li|arXiv (Cornell University)|May 31, 2022
Health Systems, Economic Evaluations, Quality of Life被引用数 4
ひとこと要約

本論文は、学習分布からのハレインジャー距離が限界にある公平性制約付き分布における予測損失の上限を特定することで、機械学習モデルのエンドツーエンドの公平性を保証するための新規フレームワークを提案する。サブポピュレーション分解と凸最適化を用い、ベースレート制約下でのモデル損失に対するきめ細やかな保証上限を計算し、既存の分布ロバストネス手法よりもきめ細やかな上限を達成している。6つの実世界データセットにおいて、感受性のある分布シフトと一般の分布シフトの両方を想定した検証を通じて、その有効性を裏付けている。

ABSTRACT

Extensive efforts have been made to understand and improve the fairness of machine learning models based on observational metrics, especially in high-stakes domains such as medical insurance, education, and hiring decisions. However, there is a lack of certified fairness considering the end-to-end performance of an ML model. In this paper, we first formulate the certified fairness of an ML model trained on a given data distribution as an optimization problem based on the model performance loss bound on a fairness constrained distribution, which is within bounded distributional distance with the training distribution. We then propose a general fairness certification framework and instantiate it for both sensitive shifting and general shifting scenarios. In particular, we propose to solve the optimization problem by decomposing the original data distribution into analytical subpopulations and proving the convexity of the subproblems to solve them. We evaluate our certified fairness on six real-world datasets and show that our certification is tight in the sensitive shifting scenario and provides non-trivial certification under general shifting. Our framework is flexible to integrate additional non-skewness constraints and we show that it provides even tighter certification under different real-world scenarios. We also compare our certified fairness bound with adapted existing distributional robustness bounds on Gaussian data and demonstrate that our method is significantly tighter.

研究の動機と目的

  • エンドツーエンドのMLモデルにおける保証された公平性を定義・計算し、公平性制約付きテスト分布における最悪ケース性能の上限を保証すること。
  • 学習データがバイアスを含むか、分布シフトが生じる高リスクのML応用分野における保証された公平性の欠如に対処すること。
  • ベースレート条件などの公平性制約を統合し、追加の非スケュー性制約をサポートできる柔軟なフレームワークを提供すること。
  • 公平性制約を統合することで、既存の分布ロバストネスの上限を改善し、よりきめ細やかな保証を達成すること。
  • 感受性のある分布シフトおよび一般の分布シフトの両方において、フレームワークのきめ細やかさと実用性を多様な実世界データセットで検証すること。

提案手法

  • 保証された公平性を、学習分布からのハレインジャー距離が限界にある公平性制約付き分布における最悪ケース予測損失の最小化という制約付き最適化問題として定式化する。
  • 感受性属性とラベルに基づいて学習分布とテスト分布をサブポピュレーションに分解し、ベースレート公平性制約を符号化する。
  • 感受性のシフトが生じる状況では、導出された低次元最適化問題の凸性を証明し、凸最適化による効率的解法を可能にする。
  • 一般のシフト状況では、分割統治戦略を適用し、可能な領域を分割し、凸性が保証された緩和された部分問題を解く。
  • 分布シフトの上限を設定するための発散測度としてハレインジャー距離を用い、ブラックボックスモデルへの一般化を可能にする。
  • ラベルまたは感受性属性に対する追加の非スケュー性制約を統合し、公平性の保証をさらにきめ細やかにする。

実験結果

リサーチクエスチョン

  • RQ1公平性制約付きで、分布シフトが限界内である状況において、モデルの予測損失に対する保証上限を定義・計算できるか?
  • RQ2サブポピュレーション分解は、感受性のシフトおよび一般のシフト状況下で、凸最適化ときめ細やかな公平性保証をどのように可能にするか?
  • RQ3ラベルまたは感受性属性に対する非スケュー性制約を統合することで、公平性保証のきめ細やかさが向上するか?
  • RQ4同じ条件下で、提案フレームワークの保証のきめ細やかさは、既存の分布ロバストネスの上限と比べてどのように異なるか?
  • RQ5公平性保証は、実世界のデータセットにおける実際のモデルの公平性を信頼できる指標として機能するか?

主な発見

  • 提案フレームワークは、公平性制約を統合した場合、既存の分布ロバストネスの上限よりも顕著にきめ細やかな公平性保証を達成している。
  • 感受性のシフト状況では、保証がきめ細やかで、テストされたすべてのハレインジャー距離レベルで最悪ケース損失を一貫して上限づけている。
  • 一般のシフト状況では、分布シフトが大きくなるに従い、損失に対する非自明で段階的に増加する上界を提供している。
  • ラベルまたは感受性属性に対する非スケュー性制約を追加することで、評価されたすべてのデータセットでよりきめ細やかな公平性保証が得られている。
  • 公平性保証は実際のモデルの公平性と強く相関している:Adult、Compas、Health、Law Schoolのデータセットでは、完全に公平なモデルが、非公平(ヴァニラ)モデルよりも常に低い保証損失を達成している。
  • Adultデータセットでは、一般のシフト下で、ヴァニラモデルの保証損失はρ=0.1のとき0.274からρ=0.5のとき0.828に増加する一方、公平モデルの損失は0.266から0.824に増加する。これは、保証が相対的な公平性レベルを反映していることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。