Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Fairness-aware Learning Under Sample Selection Bias

Wei Du, Xintao Wu|arXiv (Cornell University)|2021. 05. 24.
Ethics and Social Impacts of AI참고 문헌 24인용 수 4
한 줄 요약

이 논문은 기계학습에서 표본 선택 편향을 다루기 위해 강건하고 공정한 학습 프레임워크를 제안한다. 재가중법을 통해 편향을 교정하고, 분포 변화 상황에서도 공정성과 정확성을 확보하기 위해 최소최대 최적화를 결합한다. 워샤프스키 볼을 통해 불확실성을 모델링하고 악성 조건 하에서도 공정성을 확보함으로써, 테스트 데이터가 없을 경우에도 예측 성능과 공정성이 향상된다.

ABSTRACT

The underlying assumption of many machine learning algorithms is that the training data and test data are drawn from the same distributions. However, the assumption is often violated in real world due to the sample selection bias between the training and test data. Previous research works focus on reweighing biased training data to match the test data and then building classification models on the reweighed training data. However, how to achieve fairness in the built classification models is under-explored. In this paper, we propose a framework for robust and fair learning under sample selection bias. Our framework adopts the reweighing estimation approach for bias correction and the minimax robust estimation approach for achieving robustness on prediction accuracy. Moreover, during the minimax optimization, the fairness is achieved under the worst case, which guarantees the model's fairness on test data. We further develop two algorithms to handle sample selection bias when test data is both available and unavailable. We conduct experiments on two real-world datasets and the experimental results demonstrate its effectiveness in terms of both utility and fairness metrics.

연구 동기 및 목표

  • 학습 데이터와 테스트 데이터의 분포가 다를 때 발생하는 표본 선택 편향 문제를 해결하기 위해.
  • 특히 편향된 학습 데이터가 테스트 데이터에서 불공정한 예측을 유도할 수 있는 상황에서 분류 모델의 공정성을 확보하기 위해.
  • 표본 선택 편향을 동시에 교정하고 악성 조건 하에서도 공정성을 보장하는 통합 프레임워크를 개발하기 위해.
  • 테스트 데이터가 가용할 경우와 불가능할 경우의 두 상황을 모두 고려한 실용적인 알고리즘을 제공하여 강건성과 공정성 보장을 보장하기 위해.
  • 실세계 데이터셋을 대상으로 한 경험적 평가를 통해 제안 방법의 유효성을 입증하고, 유틸리티 및 공정성 지표 향상을 보여주기 위해.

제안 방법

  • 학습 데이터와 테스트 데이터 간의 선택 확률 비율에 기반해 학습 예제의 가중치를 조정함으로써 표본 선택 편향을 교정하기 위해 재가중 추정을 사용한다.
  • 실제 학습 분포를 중심으로 한 워샤프스키 볼 위에서 최소최대 강건 추정을 적용하여 예측 정확도의 악성 조건 하에서도 강건성을 확보한다.
  • 경계 공정성 근사 방법을 통해 손실 함수에 공정성 제약 조건을 통합하여 보호 그룹과 비보호 그룹 간의 위험 차이의 편차를 방지한다.
  • RFLearn 1(테스트 데이터 가용 시)은 학습 데이터와 테스트 데이터 간의 밀도 비율 추정을 통해 선택 확률을 추정한다.
  • RFLearn 2(테스트 데이터 비가용 시)는 클러스터 기반으로 균일한 선택 확률을 가정하고, 각 클러스터 내에서 워샤프스키 볼을 활용해 강건한 추정을 수행한다.
  • 가장 악성 조건이 예상되는 분포 하에서 수정된 손실 함수를 최적화함으로써, 예측 불가능한 테스트 데이터에 대한 공정성과 정확성의 강건성을 보장한다.

실험 결과

연구 질문

  • RQ1테스트 데이터에서의 분류기 공정성을 보장하면서도 학습 데이터의 표본 선택 편향을 어떻게 교정할 수 있는가?
  • RQ2최소최대 강건 최적화 프레임워크를 공정성 제약 조건과 효과적으로 융합할 수 있는가? 이는 분포 변화 상황에서 모델 신뢰도 향상에 기여하는가?
  • RQ3테스트 데이터가 없을 경우 선택 확률 추정이 불가능한 상황에서 어떻게 강건하고 공정한 학습을 달성할 수 있는가?
  • RQ4워샤프스키 애매함 집합을 사용할 경우 표본 선택 편향 하에서 공정성과 정확성에 어떤 영향을 미치는가?
  • RQ5실세계 데이터셋에서 기존 방법과 비교해 제안 프레임워크의 공정성 및 유틸리티 지표는 어떻게 향상되는가?

주요 결과

  • 제안된 프레임워크는 표본 선택 편향 하에서도 테스트 데이터에서 예측 정확도와 공정성을 크게 향상시켜 기준 방법보다 유틸리티 및 공정성 지표에서 뛰어난 성능을 보였다.
  • 테스트 데이터를 사용해 밀도 비율 추정을 수행하는 RFLearn 1은 표준 재가중법 및 공정성 인식 기준 방법보다 더 뛰어난 공정성과 정확도를 달성했다.
  • 테스트 데이터가 없는 상황을 고려해 설계된 RFLearn 2는 클러스터 기반 선택 확률 가정과 강건 최적화를 활용해 뛰어난 성능을 유지했다.
  • 분포 불확실성을 모델링하기 위해 워샤프스키 볼을 사용함으로써, 악성 분포 변화 상황에서도 더 강건한 예측이 가능했다.
  • 최소최대 최적화 과정 중에 공정성 제약 조건을 통합함으로써, 테스트 분포가 학습 분포에서 벗어나도 공정성이 유지됨을 보였다.
  • 두 개의 실세계 데이터셋에 대한 경험적 결과는 프레임워크가 강건성과 공정성을 효과적으로 균형 잡고 있음을 확인했으며, 위험 차이와 정확도 지표에서 명확한 향상이 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.