Skip to main content
QUICK REVIEW

[논문 리뷰] Impossibility results for fair representations

Tosca Lechner, Shai Ben-David|arXiv (Cornell University)|2021. 07. 07.
Ethics and Social Impacts of AI참고 문헌 14인용 수 5
한 줄 요약

이 논문은 기계학습에서 공정한 데이터 표현에 대한 기본적인 불가능성 결과를 증명한다: 어떤 표현도 다양한 작업 간에 인구 통계적 평등성 또는 오즈 동등성 공정성의 보장을 보장할 수 없다. 특히 데이터 분포가 변화할 경우 더욱 그렇다. 마진 분포가 사전에 알려져 있더라도, 하나의 표현으로 여러 작업에서 공정성과 정확한 분류를 동시에 확보할 수 없으며, 이는 이전 연구에서 제안된 이식 가능한 공정성 솔루션의 실현 가능성을 뒤엎는다.

ABSTRACT

With the growing awareness to fairness in machine learning and the realization of the central role that data representation has in data processing tasks, there is an obvious interest in notions of fair data representations. The goal of such representations is that a model trained on data under the representation (e.g., a classifier) will be guaranteed to respect some fairness constraints. Such representations are useful when they can be fixed for training models on various different tasks and also when they serve as data filtering between the raw data (known to the representation designer) and potentially malicious agents that use the data under the representation to learn predictive models and make decisions. A long list of recent research papers strive to provide tools for achieving these goals. However, we prove that this is basically a futile effort. Roughly stated, we prove that no representation can guarantee the fairness of classifiers for different tasks trained using it; even the basic goal of achieving label-independent Demographic Parity fairness fails once the marginal data distribution shifts. More refined notions of fairness, like Odds Equality, cannot be guaranteed by a representation that does not take into account the task specific labeling rule with respect to which such fairness will be evaluated (even if the marginal data distribution is known a priory). Furthermore, except for trivial cases, no representation can guarantee Odds Equality fairness for any two different tasks, while allowing accurate label predictions for both. While some of our conclusions are intuitive, we formulate (and prove) crisp statements of such impossibilities, often contrasting impressions conveyed by many recent works on fair representations.

연구 동기 및 목표

  • 일반적인 데이터 표현이 여러 후행 분류 작업 간에 공정성을 보장할 수 있는지 조사하기.
  • 작업별 데이터 분포에 독립적인 고정된 표현을 통해 인구 통계적 평등성과 오즈 동등성 공정성을 달성할 수 있는지 가능성 검토하기.
  • 최근 문헌에서 제기된 이식 가능한 공정한 표현의 주장과 이러한 접근법의 이론적 한계 사이의 괴리를 해결하기.
  • 표현 학습에서의 공정성의 개념적 기초를 명확히 하며, 특히 데이터 분포와 레이블링 규칙의 역할을 분석하기.
  • 전체 특징 집합을 고려하지 않으면 개별 특징의 공정성이 정의될 수 없다는 것을 입증하여, 공정성 문헌에서 일반적으로 가정되는 바를 도전하기.

제안 방법

  • 군집 소속, 예측, 레이블 간의 조건부 독립 제약 조건으로 인구 통계적 평등성(DP)과 오즈 동등성(EO)과 같은 공정성 개념을 수식화하기.
  • 모수 분포가 작업 간에 변화할 경우, 어떤 표현도 모든 분류기에서 DP 공정성을 보장할 수 있음을 증명하기.
  • 동일한 마진 분포를 가졌지만 레이블링 규칙이 다른 두 개의 서로 다른 작업에 대해, 어떤 표현도 동시에 정확한 분류기 작동과 두 작업 모두에 대한 EO 공정성 보장을 동시에 달성할 수 없음을 입증하기.
  • ε,η-공정성 보장 표현의 개념을 도입하고, 개별 특징이 공정성 보장을 하지 못하더라도 특징 조합을 통해 공정성을 달성할 수 있음을 보여주기.
  • 예측률 동등성(PRP) 공정성 분석 및 PRP 기반의 적대적 공정성이 성공률이 모든 그룹에서 동일할 경우에만 가능함을 증명하기.
  • 반례와 공식적 증명을 사용하여 평가 시점에 데이터 분포나 진짜 레이블에 접근할 수 없을 경우 공정성이 보장될 수 없음을 보여주기.

실험 결과

연구 질문

  • RQ1모수 분포가 변화할 경우, 단일 데이터 표현이 모든 후행 분류기에서 인구 통계적 평등성 공정성을 보장할 수 있는가?
  • RQ2동일한 모수 분포를 가졌지만 레이블링 규칙이 다른 두 개의 서로 다른 작업에 대해, 공정성 보장을 보장하는 표현을 설계할 수 있는가?
  • RQ3시험 시점에 진짜 레이블이나 데이터 분포에 접근할 수 없을 경우, 표현이 공정성을 보장할 수 있는가?
  • RQ4개별 특징의 공정성과 전체 표현의 공정성 사이의 관계는 무엇인가?
  • RQ5예측률 동등성 기반의 적대적 공정성이 성립하는 조건은 무엇인가?

주요 결과

  • 모수 분포가 작업 간에 변화할 경우, 분포가 사전에 알려져 있더라도 어떤 데이터 표현도 모든 분류기에서 인구 통계적 평등성 공정성을 보장할 수 없다.
  • 동일한 모수 분포를 가졌지만 상호 간에 중복되지 않는 두 개의 서로 다른 작업에 대해, 어떤 표현도 동시에 정확한 레이블 예측을 가능하게 하고 두 작업 모두에 대해 오즈 동등성 공정성을 보장할 수 없다.
  • 진짜 레이블과 모수 분포에 접근할 수 있더라도, 표현이 각 작업에 특화되지 않는 한 공정성은 작업 간 보편적으로 보장될 수 없다.
  • 개별 특징의 공정성은 정의되지 않는다; 특징가 단독으로 공정할 수 있지만 다른 특징들과의 상호작용으로 전체 표현에서 불공정성을 초래할 수 있다.
  • 예측률 동등성 기반의 적대적 공정성은 두 그룹의 성공률이 데이터 분포 하에서 동일할 경우에만 가능하다.
  • 특징의 조합은 개별 특징이나 부분 집합이 공정성 보장을 하지 못하더라도 공정성을 달성할 수 있으며, 이는 표현에서 공정성의 비가산성(non-additivity)을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.