Skip to main content
QUICK REVIEW

[논문 리뷰] Achieving Fairness at No Utility Cost via Data Reweighing with Influence

Peizhao Li, Hongfu Liu|arXiv (Cornell University)|2022. 02. 01.
Ethics and Social Impacts of AI인용 수 6
한 줄 요약

이 논문은 영향 함수를 사용하여 훈련 데이터에 대해 세분화되고 샘플별로 특화된 가중치를 부여하는 데이터 재가중 기법을 제안한다. 이는 예측 성능을 희생시키지 않고도 공정성을 향상시킨다. 제약 조건이 있는 선형 프로그래밍을 통해 가중치를 최적화함으로써, 여러 개의 표본 데이터셋에서 기준 방법 대비 비용 없는 공정성(예측 성능을 유지하거나 약간 향상시키면서 동등 기회를 향상)을 달성한다.

ABSTRACT

With the fast development of algorithmic governance, fairness has become a compulsory property for machine learning models to suppress unintentional discrimination. In this paper, we focus on the pre-processing aspect for achieving fairness, and propose a data reweighing approach that only adjusts the weight for samples in the training phase. Different from most previous reweighing methods which usually assign a uniform weight for each (sub)group, we granularly model the influence of each training sample with regard to fairness-related quantity and predictive utility, and compute individual weights based on influence under the constraints from both fairness and utility. Experimental results reveal that previous methods achieve fairness at a non-negligible cost of utility, while as a significant advantage, our approach can empirically release the tradeoff and obtain cost-free fairness for equal opportunity. We demonstrate the cost-free fairness through vanilla classifiers and standard training processes, compared to baseline methods on multiple real-world tabular datasets. Code available at https://github.com/brandeis-machine-learning/influence-fairness.

연구 동기 및 목표

  • 알고리즘 결정에서 지속적인 공정성-성능 간 상충 문제를 해결하기 위해 훈련 샘플을 재가중하는 것.
  • 모델 아키텍처나 훈련 절차를 수정하지 않고 데이터 편향을 수정하는 전처리 방법을 개발하는 것.
  • 샘플 수준의 영향 추정을 통해 비용 없는 공정성—성능 저하 없이 공정성을 향상시키는 것—을 실현하는 것.
  • 기존 머신러닝 파이프라인과 표준 분류기와 호환되는 실용적이고 즉시 사용 가능한 솔루션을 제공하는 것.

제안 방법

  • 이 방법은 영향 함수를 사용해 각 샘플이 공정성과 성능에 미치는 영향을 계산한다. 영향 함수는 전체 재학습 없이도 훈련 샘플을 제거했을 때의 영향을 추정한다.
  • 공정성(예: 동등 기회)과 성능(예: 예측 정확도)에 대한 제약 조건 하에 최적의 재가중치를 결정하기 위해 선형 프로그래밍 문제를 설정한다.
  • 일반화를 보장하기 위해 검증 세트에서 영향을 측정하고, 표준 훈련 이전에 한 번의 통과로만 재가중 처리를 적용한다.
  • 잘못 레이블링된 또는 공정성에 영향을 미치는 샘플은 가중치를 낮추고, 품질이 높은 샘플은 유지하여 성능 손실를 최소화한다.
  • 그룹 단위로 샘플을 제거할 때 영향 추정 오차를 보정하기 위해 하이퍼파rameter를 도입하여 강건성을 향상시킨다.
  • 이 방법은 표준 분류기와 표준 훈련 절차를 사용해 실제 표본 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1기계 학습 모델에서 성능 손실 없이 공정성을 향상시킬 수 있는가?
  • RQ2그룹 수준의 균일한 가중치 부여보다 샘플 수준의 영향 추정이 더 정밀한 재가중을 가능하게 하는가?
  • RQ3성능을 유지하거나 향상시키면서 공정성을 향상시키는 재가중 전략이 존재하는가?
  • RQ4영향 함수가 샘플 제거가 공정성과 성능에 실제 미치는 영향을 얼마나 정확히 예측할 수 있는가?
  • RQ5전처리 방법이 다양한 실제 데이터셋에서 비용 없는 공정성을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 대부분의 데이터셋에서 성능 손실 없이 공정성을 향상시켜 전통적인 공정성-성능 상충 문제를 경험적으로 해소한다.
  • 기준 방법과는 달리, 이 방법은 공정성을 향상시키기 위해 성능을 떨어뜨리지 않고 오히려 유지하거나 약간 향상시키며 동등 기회를 향상시킨다.
  • 일부 경우를 제외하고는 영향 함수가 이소-리트레이닝 이후 실제 모델 변화를 높은 피어슨 상관계수(피어슨 상관계수 > 0.8)로 정확히 예측한다.
  • 다양한 데이터셋에서 히우리스틱, 학습 기반, 적대적 재가중 기반 기준 방법 대비 이 방법이 공정성과 성능 안정성 측면에서 뛰어나다.
  • 기본 비율 차이가 높은 경우와 같이 성능이 약간 감소하는 경우에도 공정성 향상 효과가 뚜렷하여 강건성을 입증한다.
  • 이 방법은 다양한 모델과 데이터셋(예: Adult, Compas 포함)에서 효과적이며 표준 훈련 파이프라인과 호환된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.