Skip to main content
QUICK REVIEW

[논문 리뷰] A Distributionally Robust Approach to Fair Classification

Bahar Taşkesen, Viet Anh Nguyen|arXiv (Cornell University)|2020. 07. 18.
Health Systems, Economic Evaluations, Quality of Life참고 문헌 65인용 수 20
한 줄 요약

이 논문은 Wasserstein 볼 기반의 불확실성 집합과 새로운 볼록 불공정 측정법을 사용하여 불공정성을 최소화함으로써 이元분류에서 공정성을 향상시키는 분포로 불확실한 로지스틱 회귀 모델을 제안한다. 합성 및 실세계 데이터셋에서 정확도 손실를 최소화하면서도 공정성을 향상시킨다.

ABSTRACT

We propose a distributionally robust logistic regression model with an unfairness penalty that prevents discrimination with respect to sensitive attributes such as gender or ethnicity. This model is equivalent to a tractable convex optimization problem if a Wasserstein ball centered at the empirical distribution on the training data is used to model distributional uncertainty and if a new convex unfairness measure is used to incentivize equalized opportunities. We demonstrate that the resulting classifier improves fairness at a marginal loss of predictive accuracy on both synthetic and real datasets. We also derive linear programming-based confidence bounds on the level of unfairness of any pre-trained classifier by leveraging techniques from optimal uncertainty quantification over Wasserstein balls.

연구 동기 및 목표

  • 기계학습에서의 알고리즘 편향을 다루며, 특히 채용, 대출 및 형사 사법과 같은 민감한 의사결정 맥락에서의 편향을 해결한다.
  • 감정적 속성의 명시적 포함 없이도 간접적 차별을 방지함으로써, 공정성에 대한 인식이 없는 접근의 한계를 극복한다.
  • Wasserstein 볼을 사용하여 분포 불확실성 하에서 공정성을 보장하는 실현 가능한 최적화 프레임워크를 개발한다.
  • Wasserstein 볼 상의 최적 불확실성 정량화를 통해 사전 학습된 분류기의 불공정성에 대한 신뢰구간을 제공한다.
  • 볼록이고 분포로 불확실한 공식화를 통해 예측 정확도를 크게 희생시키지 않고도 공정성을 향상시킬 수 있음을 입증한다.

제안 방법

  • 실증 분포 중심의 Wasserstein 볼을 사용하여 분포 불확실성을 모델링하는 분포로 불확실한 로지스틱 회귀 모델을 수립한다.
  • 보호 그룹과 불리한 그룹 간의 동일한 기회를 보장하기 위해, 등급화된 기회를 장려하는 새로운 볼록 불공정 측정법을 도입한다.
  • Wasserstein 모호성 집합의 구조를 활용하여 강건 최적화 문제를 실현 가능한 볼록 프로그램으로 변환한다.
  • 모든 사전 학습된 분류기의 불공정 수준에 대해 최적 불확실성 정량화를 통해 선형 프로그래밍 기반의 신뢰구간을 유도한다.
  • 실세계 및 합성 데이터셋에 이 방법을 적용하여, 공정성과 정확도를 균형 잡기 위해 Wasserstein 반경과 정규화 파라미터를 튜닝한다.
  • 정확도 기준을 설정한 교차 검증을 통해 최적의 초모델 하이퍼파rameter를 선택함으로써, 성능 저하 없이 공정성 향상을 확보한다.

실험 결과

연구 질문

  • RQ1분포로 불확실한 최적화 프레임워크는 예측 정확도를 희생시키지 않고도 로지스틱 회귀에서 불공정성을 효과적으로 감소시킬 수 있는가?
  • RQ2민감한 속성 제약 조건 하에서 분포 불확실성을 모델링하기 위해 Wasserstein 볼을 사용할 경우, 분류의 공정성은 어떻게 향상되는가?
  • RQ3볼록 불공정 측정법은 계산적으로 실현 가능하면서도 등급화된 기회를 얼마나 잘 촉진할 수 있는가?
  • RQ4Wasserstein 볼 상의 최적 불확실성 정량화를 통해 사전 학습된 분류기의 불공정성에 대한 신뢰구간을 신뢰성 있게 도출할 수 있는가?
  • RQ5다양한 데이터셋에서 기존의 공정 학습 접근법과 비교했을 때, 제안된 방법은 공정성-정확도 트레이드오프 측면에서 어떻게 성능을 내는가?

주요 결과

  • 제안된 DR-FLR 방법은 표준 로지스틱 회귀 및 기타 기준선 대비 유의미하게 낮은 불공정성(예: Drug 데이터셋에서 Det-UNF 기준 0.04 ± 0.04)을 달성하면서 정확도 손실가 없이 성능을 유지한다.
  • Adult 데이터셋에서 DR-FLR는 결정론적 불공정성을 0.06 ± 0.06으로 줄였으며, FLR(0.06 ± 0.06), DOB+(0.16 ± 0.10), LR(0.08 ± 0.06)를 모두 능가한다.
  • COMPAS 데이터셋에서는 DR-FLR가 확률적 불공정성을 0.03 ± 0.02로 줄였고, FLR(0.10 ± 0.03), LR(0.12 ± 0.08)보다 우수하다.
  • 모든 지표에서 불공정성을 크게 줄였음에도 불구하고, DR-FLR는 높은 정확도(예: Drug에서 0.79 ± 0.01, Adult에서 0.80 ± 0.01)를 유지한다.
  • 유도된 선형 프로그래밍 기반의 신뢰구간을 통해 분포 불확실성 하에서의 최악의 불공정성 수준이 효과적으로 제한됨을 확인하였으며, 이는 접근법의 강건성을 검증한다.
  • 분포로 불확실성에 기반한 접근법은 정확도 저하를 최소화하면서도 최첨단의 공정성 향상을 달성하여, 공정 분류에서 분포로 불확실성의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.