[논문 리뷰] Wasserstein Robust Classification with Fairness Constraints
이 논문은 유형-∞ 워샤프스키 애매함 집합을 사용하여 경험적 분포 주변의 분포 불확실성을 모델링하고, 등가 기회(EO) 기준을 통해 공정성을 강제하는 분포로 불확실성 분류 프레임워크를 제안한다. 이는 혼합정수계획법으로의 보수적 재구성으로 이어지고, 더 나아가 확장 가능한 허프-손 기반의 볼록 모델을 개발하여 여러 데이터셋에서 정확도 손실을 최소화하면서도 공정성을 향상시킨다.
We propose a distributionally robust classification model with a fairness constraint that encourages the classifier to be fair in view of the equality of opportunity criterion. We use a type-$\infty$ Wasserstein ambiguity set centered at the empirical distribution to model distributional uncertainty and derive a conservative reformulation for the worst-case equal opportunity unfairness measure. We establish that the model is equivalent to a mixed binary optimization problem, which can be solved by standard off-the-shelf solvers. To improve scalability, we further propose a convex, hinge-loss-based model for large problem instances whose reformulation does not incur any binary variables. Moreover, we also consider the distributionally robust learning problem with a generic ground transportation cost to hedge against the uncertainties in the label and sensitive attribute. Finally, we numerically demonstrate that our proposed approaches improve fairness with negligible loss of predictive accuracy.
연구 동기 및 목표
- 분포로 불확실성 분류에 공정성 제약 조건을 통합하여 기계 학습에서의 알고리즘 편향 문제를 해결하는 것.
- 경험 분포 중심의 유형-∞ 워샤프스키 애매함 집합을 사용하여 분포 불확실성을 모델링하는 것.
- 감정 그룹 간 진정 양성률이 동일하도록 보장하는 등가 기회 기준을 통해 공정성을 강제하는 것.
- 분포 불확실성 하에서 최악의 상황에서의 EO 불공정도 측정치에 대해 보수적이고 해석 가능한 재구성 방법을 개발하는 것.
- 이진 변수를 제거하고 대규형 데이터셋에 대한 확장성을 향상시키기 위해 볼록 허프-손 기반의 근사 모델을 개발하는 것.
제안 방법
- 경험 데이터 분포 주변의 분포 불확실성을 모델링하기 위해 유형-∞ 워샤프스키 애매함 집합을 사용한다.
- 이중성 이론을 활용하여 최악의 상황에서의 EO 불공정도 측정치에 대한 보수적 재구성을 유도한다.
- 정확한 해를 중간 규모 문제에 대해 얻기 위해 강건한 공정성 문제를 혼합정수선형계획문제(MILP)로 재구성한다.
- 이진 변수를 피하고 대규형 인스턴스에 대한 확장성을 향상시키기 위해 볼록 허프-손 기반의 근사 모델을 제안한다.
- 라벨 및 민감 속성 불확실성에 대비하기 위해 일반적인 기초 운송 비용을 통합한다.
- MILP는 표준 솔버를, 볼록 근사 모델은 기울기 기반 방법을 사용하여 실용적인 구현을 가능하게 한다.

실험 결과
연구 질문
- RQ1분포로 불확실성 하에서 강건한 분류 모델이 효과적으로 공정성을 강제할 수 있는가?
- RQ2워샤프스키 애매함 집합 하에서 최악의 상황에서의 등가 기회 불공정도를 어떻게 보수적으로 재구성할 수 있는가?
- RQ3강건한 공정 분류에서 공정성, 정확도, 계산 효율성 간의 상호 상충 관계는 어떠한가?
- RQ4볼록 허프-손 기반의 재구성 모델은 대규형 데이터셋에 확장 가능하면서도 높은 공정성과 정확도를 유지할 수 있는가?
- RQ5최신의 공정성 인식 모델과 비교할 때 제안된 방법은 공정성 및 예측 성능 측면에서 어떻게 성능을 내는가?
주요 결과
- 제안된 방법은 모든 테스트 데이터셋에서 예측 정확도 손실을 최소화하면서도 뚜렷한 공정성 향상을 달성한다.
- 유형-∞ 워샤프스키 애매함 집합은 유형-1에 비해 더 확장 가능한 콘형 재구성 가능성을 제공하면서도 통계적 보장을 유지한다.
- 혼합정수계획법 재구성은 EO 불공정도를 명시적으로 경계하여 강력한 공정성 보장을 제공한다.
- 허프-손 기반 볼록 모델(HDRFC)은 모든 데이터셋에서 1초 이내에 해를 구하고, 1000개의 샘플에서도 DRFLR 및 ε-DRFC보다 런타임에서 뛰어난 성능을 보인다.
- HDRFC 모델은 Adult, Drug, COMPAS 및 Synthetic 데이터셋에서 DOB+ 및 DRFLR보다 공정성-정확도 트레이드오프 측면에서 일관되게 뛰어난 성능을 보인다.
- Arrhythmia 데이터셋(N=452)에서는 HDRFC와 DOB+가 0.2초 이내에 해를 구하지만, ε-DRFC는 N=1000일 때 10분이 넘게 소요된다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.