Skip to main content
QUICK REVIEW

[論文レビュー] Assessing Fairness in the Presence of Missing Data

Yiliang Zhang, Qi Long|PubMed|Dec 7, 2021
Privacy-Preserving Technologies in Data参考文献 6被引用数 11
ひとこと要約

本稿では、欠損データがある状況下で完全ケースに限定して学習された機械学習モデルにおける公平性推定のための再重み付け手法を提案し、適切な重み付けが公平性推定におけるバイアスを低減できることを示している。本稿は、欠損データ下での公平性推定誤差に対する理論的境界を初めて提示し、推定バイアスが完全ケース分布と完全データ分布の乖離および感受性スコア重みの正確さに依存することを示している。

ABSTRACT

Missing data are prevalent and present daunting challenges in real data analysis. While there is a growing body of literature on fairness in analysis of fully observed data, there has been little theoretical work on investigating fairness in analysis of incomplete data. In practice, a popular analytical approach for dealing with missing data is to use only the set of complete cases, i.e., observations with all features fully observed to train a prediction algorithm. However, depending on the missing data mechanism, the distribution of complete cases and the distribution of the complete data may be substantially different. When the goal is to develop a fair algorithm in the complete data domain where there are no missing values, an algorithm that is fair in the complete case domain may show disproportionate bias towards some marginalized groups in the complete data domain. To fill this significant gap, we study the problem of estimating fairness in the complete data domain for an arbitrary model evaluated merely using complete cases. We provide upper and lower bounds on the fairness estimation error and conduct numerical experiments to assess our theoretical results. Our work provides the first known theoretical results on fairness guarantee in analysis of incomplete data.

研究の動機と目的

  • 欠損値を含むデータにおける公平性推定に関する理論的理解の欠落を埋める。
  • 完全ケース分析における欠損データメカニズム(MCAR、MAR、MNAR)が公平性推定に与える影響を調査する。
  • 完全ケースとターゲットの完全データ母集団との間のドメインシフトに起因する公平性推定バイアスを是正する再重み付け手法を開発する。
  • サンプルサイズおよび重み付けの正確さの影響を定量化するため、公平性推定誤差の理論的境界を提示する。
  • MCAR、MAR、MNARのさまざまな欠損データメカニズム下で、実世界のデータセット(COMPASおよびADNI)を用いて本手法を実証的に検証する。

提案手法

  • 完全ケースに感受性スコアに基づく重みを割り当てることで、完全ケース分析における選択バイアスを是正する再重み付け手法を提案する。
  • 公平性推定誤差の上界および下界を導出し、サンプルサイズ、分布間の全 Variation 距離、および重み付けの正確さに関連する項に分解する。
  • 完全ケース分布と完全データ分布の間の全 Variation 距離を、ドメインシフトの主要な指標として用いる。
  • 分類および回帰タスクの両方に対して、公平性指標として正確性パラメータギャップを用い、再重み付け手法を適用する。
  • MARおよびMNAR設定下で、欠損のメカニズム(感受性スコア)を推定するためにロジスティック回帰および他のモデルを用いる。
  • MCAR、MAR、MNARメカニズム下で、COMPASおよびADNIデータセットを用いたシミュレーションおよび実データ実験を通じて理論的結果を検証する。

実験結果

リサーチクエスチョン

  • RQ1完全ケースのみを用いてモデルを学習する場合、欠損データが公平性推定にどのように影響するか?
  • RQ2完全ケース分布と完全データ分布の乖離と公平性推定誤差の理論的関係は何か?
  • RQ3推定された感受性スコアに基づく再重み付けは、不完全データ環境下での公平性推定バイアスを低減できるか?
  • RQ4MCAR、MAR、MNARといった異なる欠損データメカニズムは、完全ケース分析下での公平性推定のパフォーマンスにどのように影響するか?
  • RQ5感受性群間のサンプル不均衡は、不完全データ下での公平性推定バイアスにどの程度影響を及ぼすか?

主な発見

  • MCAR下では、すべての重み付け戦略(包括的推定を含む)が、期待どおりに同等で妥当な公平性推定をもたらす。
  • MAR下では、真の感受性スコア重みが最小バイアスを示し、正しく指定されたモデルを用いたロジスティック回帰ベースの重み付けもほぼ同等の性能を示す。
  • MNAR下では、すべての作業モデルが誤指定であり、真の重みよりもすべての重み付け戦略がより大きなバイアスを示す。これは、モデル誤指定の挑戦を強調する。
  • 感受性群間のサンプル不均衡は、特に無視できない欠損メカニズム下で、公平性推定バイアスを顕著に増大させる。
  • 公平性推定誤差の理論的境界は実証的に検証され、ドメインシフトおよび重み付けの正確さの悪化に伴いバイアスが増加することが示された。
  • 結果は、モデルが完全ケースで学習されていようとも、欠損データメカニズムが適切に考慮されない場合、公平性推定が著しくバイアスを含む可能性があることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。