Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Instance-Level Impact of Fairness Constraints

Jialu Wang, Xin Wang|arXiv (Cornell University)|2022. 06. 30.
Gender Politics and Representation인용 수 4
한 줄 요약

이 논문은 영향 함수를 활용하여 공정성 제약 조건 하에서 훈련 예제의 인스턴스 수준 영향을 정량화하는 공정성 영향 함수를 도입한다. 공정성 점수 기반으로 높은 영향도를 가진 예제를 제거함으로써 공정성 위반을 크게 줄일 수 있으며, 정확도 저하도 최소화하여 표본, 이미지, NLP 데이터셋에서 유리한 트레이드오프를 달성한다.

ABSTRACT

A variety of fairness constraints have been proposed in the literature to mitigate group-level statistical bias. Their impacts have been largely evaluated for different groups of populations corresponding to a set of sensitive attributes, such as race or gender. Nonetheless, the community has not observed sufficient explorations for how imposing fairness constraints fare at an instance level. Building on the concept of influence function, a measure that characterizes the impact of a training example on the target model and its predictive performance, this work studies the influence of training examples when fairness constraints are imposed. We find out that under certain assumptions, the influence function with respect to fairness constraints can be decomposed into a kernelized combination of training examples. One promising application of the proposed fairness influence function is to identify suspicious training examples that may cause model discrimination by ranking their influence scores. We demonstrate with extensive experiments that training on a subset of weighty data examples leads to lower fairness violations with a trade-off of accuracy.

연구 동기 및 목표

  • 공정성 제약 조건이 적용되었을 때 개별 훈련 인스턴스가 모델의 공정성에 어떻게 영향을 미치는지 이해하는 것.
  • 모델 차별화에 기여하는 고영향도 훈련 예제를 식별하고 감시할 수 있는 방법을 개발하는 것.
  • 편향 완화를 위해 공정성-영향도가 높은 인스턴스를 우선순위로 삼는 데이터 전처리 전략을 가능하게 하는 것.
  • 공정성-영향도 점수 기반으로 훈련 데이터를 정제할 때 공정성과 정확도 사이의 트레이드오프를 평가하는 것.

제안 방법

  • 공정성 제약 조건 하에서 단일 훈련 예제를 제거했을 때 모델 예측의 변화를 측정하기 위해 영향 함수 프레임워크를 적응하는 것.
  • 특정 가정 하에서 훈련 예제의 커널 기반 조합으로 공정성-영향도를 정의하여 효율적인 계산을 가능하게 하는 것.
  • 영향 함수의 일阶 근사법을 적용하여 각 훈련 예제가 공정성과 정확도에 미치는 영향을 추정하는 것.
  • 훈련 인스턴스를 공정성-영향도 점수 기반으로 순위를 매기고, 낮은 영향도를 가진 인스턴스를 제거하여 공정성 위반을 줄이는 것.
  • 다양한 도메인에 걸쳐 구현: 표본 데이터(Adult), 이미지(CelebA), NLP(Jigsaw Toxicity 데이터셋).
  • 공정성 제약 조건을 적용한 표준 모델(MLP, ResNet-18, BERT)을 사용하고 정확도 및 공정성 위반 지표를 통해 성능을 평가하는 것.

실험 결과

연구 질문

  • RQ1공정성 제약 조건이 적용되었을 때 개별 훈련 인스턴스는 모델의 공정성에 어떻게 영향을 미치는가?
  • RQ2공정성-영향도 점수는 불공정 예측에 비례적으로 기여하는 훈련 예제를 식별할 수 있는가?
  • RQ3공정성-영향도 점수 기반으로 훈련 데이터를 정제할 때 공정성과 정확도 사이의 트레이드오프는 어떠한가?
  • RQ4다양한 데이터 모odal에서 공정성-영향도 기반 정제, 정확도 기반 정제, 무작위 정제 간의 성능 비교는 어떠한가?
  • RQ5공정성-영향도 분석은 정확도 저하를 최소화하면서 편향을 줄이기 위한 전처리 전략을 안내할 수 있는가?

주요 결과

  • 공정성-영향도 점수 기반으로 훈련 예제를 정제하면, 특히 데이터 크기가 40% 이하일 경우 공정성 위반을 크게 줄일 수 있다.
  • Adult 데이터셋에서, 데이터 크기가 20%를 초과할 경우 공정성 기반 정제는 정확도 기반 정제와 유사한 정확도를 유지하면서 공정성 위반을 크게 줄였다.
  • CelebA에서 공정성-영향도 기반 정제는 정확도 기반 정제와 유사한 정확도 추세를 유지하지만, 데이터 크기가 감소할수록 공정성 위반을 더 효과적으로 줄였다.
  • Jigsaw Toxicity에서 공정성 기반 정제는 표준편차가 더 낮아 안정적인 공정성 완화를 보이며, 기준 방법(lfat)과 유사한 성능을 달성했다.
  • 데이터 크기가 20% 이하로 감소할 경우 무작위 정제는 높은 공정성 위반과 열악한 성능을 보였으며, 이는 정보 기반 데이터 선택의 중요성을 시사한다.
  • 이 방법은 극도로 작은 훈련 세트(예: <10%)는 성능 저하가 심각하게 발생함을 드러내어 효과적인 공정성-영향도 기반 정제의 하한선을 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.