Skip to main content
QUICK REVIEW

[論文レビュー] Understanding Instance-Level Impact of Fairness Constraints

Jialu Wang, Xin Wang|arXiv (Cornell University)|Jun 30, 2022
Gender Politics and Representation被引用数 4
ひとこと要約

本稿では、影響関数を活用して、公平性制約下での訓練例のインスタンスレベルの影響を定量化するための公平性影響関数を導入する。実験では、公平性スコアに基づいて高い影響を持つ訓練例を削除することで、精度の低下を最小限に抑えつつ公平性違反を著しく低減できることを示し、表形式データ、画像、NLPのデータセットにおいて良好なトレードオフを達成している。

ABSTRACT

A variety of fairness constraints have been proposed in the literature to mitigate group-level statistical bias. Their impacts have been largely evaluated for different groups of populations corresponding to a set of sensitive attributes, such as race or gender. Nonetheless, the community has not observed sufficient explorations for how imposing fairness constraints fare at an instance level. Building on the concept of influence function, a measure that characterizes the impact of a training example on the target model and its predictive performance, this work studies the influence of training examples when fairness constraints are imposed. We find out that under certain assumptions, the influence function with respect to fairness constraints can be decomposed into a kernelized combination of training examples. One promising application of the proposed fairness influence function is to identify suspicious training examples that may cause model discrimination by ranking their influence scores. We demonstrate with extensive experiments that training on a subset of weighty data examples leads to lower fairness violations with a trade-off of accuracy.

研究の動機と目的

  • 公平性制約が適用された際、個々の訓練インスタンスがモデルの公平性にどのように影響するかを理解すること。
  • モデルの差別的予測に寄与する高影響度の訓練例を特定・監査するための手法を開発すること。
  • 公平性に与える影響度が大きいインスタンスを優先的に処理するデータ前処理戦略を可能にすること。
  • 公平性インフレエンススコアに基づく訓練データの削除における、公平性と精度のトレードオフを評価すること。

提案手法

  • 公平性制約下で単一の訓練例を削除した際のモデル予測の変化を測定するため、影響関数フレームワークを適応する。
  • 特定の仮定の下で、訓練例のカーネル化された組み合わせとして公平性インフレエンスを定式化し、計算を効率化する。
  • 影響関数の一次近似を適用して、各訓練例が公平性および精度に与える影響を推定する。
  • 訓練インスタンスを公平性インフレエンススコアでランク付けし、低影響度の例を削除することで、公平性違反を低減する。
  • 表形式データ(Adult)、画像(CelebA)、NLP(Jigsaw Toxicityデータセット)という多様な分野に本手法を適用する。
  • 公平性制約を適用した標準モデル(MLP、ResNet-18、BERT)を用い、精度および公平性違反度の指標を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1公平性制約が適用された際、個々の訓練インスタンスはモデルの公平性にどのように影響するか?
  • RQ2公平性インフレエンススコアは、不平等な予測に顕著に寄与する訓練例を特定できるか?
  • RQ3公平性インフレエンススコアに基づく訓練データの削除における、公平性と精度のトレードオフはいかなるものか?
  • RQ4異なるデータモダリティにおいて、公平性インフレエンスに基づく削除の性能は、精度に基づくまたはランダムな削除と比較してどうなるか?
  • RQ5公平性インフレエンス分析は、精度の低下を最小限に抑えながらバイアス低減を実現するための前処理戦略をどのように導くことができるか?

主な発見

  • 公平性インフレエンススコアに基づく訓練例の削除により、特にデータサイズが40%未満の場合、公平性違反が大幅に低減される。
  • Adultデータセットでは、データサイズが20%を超えると、公平性に基づく削除は精度の面で精度に基づく削除と同等の性能を維持するが、公平性違反は顕著に低減される。
  • CelebAでは、公平性インフレエンスに基づく削除は精度に基づく削除と同等の精度トレンドを示すが、データサイズが小さい場合に公平性違反の低減がより顕著に実現される。
  • Jigsaw Toxicityでは、公平性に基づく削除はベースライン手法(lfatr)と同等の性能を達成するが、標準偏差が低いため、より安定した公平性低減が実現されている。
  • ランダムな削除では、データサイズが20%未満になると高い公平性違反と悪化した性能が生じるため、データ選択の知的根拠の重要性が浮き彫りになる。
  • 本手法により、極めて小さな訓練セット(例:10%未満)では性能が著しく劣化することが明らかになったため、効果的な公平性インフレエンスに基づく削除には下限があると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。