Skip to main content
QUICK REVIEW

[論文レビュー] Impossibility results for fair representations

Tosca Lechner, Shai Ben-David|arXiv (Cornell University)|Jul 7, 2021
Ethics and Social Impacts of AI参考文献 14被引用数 5
ひとこと要約

この論文は、機械学習における公平なデータ表現の根本的不可能性を証明している:異なるタスク間で、データ分布のシフトが生じる場合、いかなる表現でも、デモグラフィックパリティやオッズ同等性の公平性を保証することはできない。特に、周辺分布が既知であっても、複数のタスクにおいて一貫した表現を用いることで、公平性と正確な分類が両立できない。これは、先行研究で提唱された転送可能な公平性ソリューションの実現可能性を根底から揺るがすものである。

ABSTRACT

With the growing awareness to fairness in machine learning and the realization of the central role that data representation has in data processing tasks, there is an obvious interest in notions of fair data representations. The goal of such representations is that a model trained on data under the representation (e.g., a classifier) will be guaranteed to respect some fairness constraints. Such representations are useful when they can be fixed for training models on various different tasks and also when they serve as data filtering between the raw data (known to the representation designer) and potentially malicious agents that use the data under the representation to learn predictive models and make decisions. A long list of recent research papers strive to provide tools for achieving these goals. However, we prove that this is basically a futile effort. Roughly stated, we prove that no representation can guarantee the fairness of classifiers for different tasks trained using it; even the basic goal of achieving label-independent Demographic Parity fairness fails once the marginal data distribution shifts. More refined notions of fairness, like Odds Equality, cannot be guaranteed by a representation that does not take into account the task specific labeling rule with respect to which such fairness will be evaluated (even if the marginal data distribution is known a priory). Furthermore, except for trivial cases, no representation can guarantee Odds Equality fairness for any two different tasks, while allowing accurate label predictions for both. While some of our conclusions are intuitive, we formulate (and prove) crisp statements of such impossibilities, often contrasting impressions conveyed by many recent works on fair representations.

研究の動機と目的

  • 一般的なデータ表現が、複数の下流分類タスクにおいて公平性を保証できるかどうかを調査すること。
  • タスク固有のデータ分布とは独立して、固定された表現を通じてデモグラフィックパリティおよびオッズ同等性の公平性を達成する可能性を検討すること。
  • 最近の文献における転送可能な公平な表現の主張と、こうしたアプローチの理論的限界との間に生じる矛盾を解消すること。
  • 特に、データ分布とラベル付けルールの役割を踏まえた、表現学習における公平性の概念的基盤を明確にすること。
  • 個々の特徴の公平性は、全特徴集合を考慮しない限り定義できないことの実証を行い、公平性文献における一般的な仮定に挑戦すること。

提案手法

  • グループメンバーシップ、予測、ラベルの条件付き独立制約として、デモグラフィックパリティ(DP)やオッズ同等性(EO)といった公平性の概念を形式化すること。
  • マージナルデータ分布がタスク間でシフトする場合、いかなる表現でもすべての分類器に対してDP公平性を保証できないことを証明すること。
  • 同じマージナル分布だが異なるラベル付けルールを持つ2つの異なるタスクに対して、いかなる表現でも正確な分類器の構築とEO公平性の両方を同時に達成できないことを示すこと。
  • (ε,η)-公平性を促進する表現の概念を導入し、特徴の組み合わせによって、個々の特徴が公平性を促進しない場合でも公平性を達成できることを示すこと。
  • 予測率パリティ(PRP)公平性を分析し、PRPにおける敵対的公平性が、両グループの成功率がデータ分布上で等しい場合にのみ可能であることを証明すること。
  • 反例と形式的証明を用いて、評価時におけるデータ分布や真のラベルへのアクセスがなければ、公平性を保証できないことを示すこと。

実験結果

リサーチクエスチョン

  • RQ1マージナルデータ分布が変化する場合でも、1つのデータ表現がすべての下流分類器に対してデモグラフィックパリティ公平性を保証できるか?
  • RQ2同じマージナルデータ分布だが異なるラベル付けルールを持つ2つの異なるタスクに対して、オッズ同等性公平性を保証する表現を設計することは可能か?
  • RQ3テスト時における真のラベルやデータ分布へのアクセスがなければ、表現が公平性を保証できるか?
  • RQ4個々の特徴の公平性と、完全な表現の公平性との関係は何か?
  • RQ5予測率パリティに関して、敵対的公平性がどのような条件下で達成可能か?

主な発見

  • マージナルデータ分布がタスク間でシフトする場合でさえ、事前に分布が分かっていても、いかなるデータ表現でも、すべての分類器に対してデモグラフィックパリティ公平性を保証できない。
  • 同じマージナル分布だが非冗長な2つの異なるタスクに対して、いかなる表現でも正確なラベル予測と、両タスクにおけるオッズ同等性公平性の両方を同時に達成できない。
  • 真のラベルやマージナル分布へのアクセスがあるとしても、表現が各タスクに特化して設計されていなければ、公平性はタスク全体にわたって普遍的に保証されない。
  • 個々の特徴の公平性は定義されない。特徴が単体では公平であっても、他の特徴との相互作用によって全体の表現が不平等になることがある。
  • 予測率パリティ(PRP)における敵対的公平性は、両グループの成功率がデータ分布上で等しい場合にのみ可能である。
  • 特徴の組み合わせによって、個々の特徴や部分集合が公平性を促進しない場合でも、公平性を達成できることがあり、これは表現における公平性の加法的でない性質を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。