[논문 리뷰] Understanding and Mitigating Accuracy Disparity in Regression
이 논문은 인구 통계적 하위군 간 회귀 모델의 정확도 격차를 완화하기 위한 이론적 프레임워크와 알고리즘적 접근을 제안한다. 모델이 전역 손실을 최소화하더라도, 가장자리 레이블 분포의 차이와 조건부 표현의 차이로 인해 격차가 발생함을 설명하는 오차 분해 정리 도입을 통해, 총 변동 거리와 워샤르슈타인 거리를 사용한 두 가지 분포 정렬 알고리즘을 설계하여, 다섯 가지 벤치마크 데이터셋에서 예측 성능을 유지하면서도 격차를 효과적으로 감소시킴을 입증한다.
With the widespread deployment of large-scale prediction systems in high-stakes domains, e.g., face recognition, criminal justice, etc., disparity in prediction accuracy between different demographic subgroups has called for fundamental understanding on the source of such disparity and algorithmic intervention to mitigate it. In this paper, we study the accuracy disparity problem in regression. To begin with, we first propose an error decomposition theorem, which decomposes the accuracy disparity into the distance between marginal label distributions and the distance between conditional representations, to help explain why such accuracy disparity appears in practice. Motivated by this error decomposition and the general idea of distribution alignment with statistical distances, we then propose an algorithm to reduce this disparity, and analyze its game-theoretic optima of the proposed objective functions. To corroborate our theoretical findings, we also conduct experiments on five benchmark datasets. The experimental results suggest that our proposed algorithms can effectively mitigate accuracy disparity while maintaining the predictive power of the regression models.
연구 동기 및 목표
- 회귀 모델에서 인구 통계적 그룹 간 정확도 격차의 근본 원인을 이해하기 위해.
- 특히 가장자리 레이블 분포나 조건부 표현이 그룹 간 다를 경우 정확도 격차가 어떻게 발생하는지를 수학적으로 형식화하기 위해.
- 예측 성능을 유지하면서 정확도 격차를 완화하는 알고리즘적 개입 방법을 개발하기 위해.
- 정의된 최적화 목표 함수에 대한 게임 이론적 분석을 통해 정의된 정의 기반 회귀의 평형 행동을 이해하기 위해.
- 실제 벤치마크 데이터셋에서 제안된 방법의 효과성을 실증적으로 검증하기 위해.
제안 방법
- 정확도 격차를 두 성분으로 분리하는 오차 분해 정리 도입: 가장자리 레이블 분포 간 거리와 조건부 표현 간 거리.
- 총 변동 거리와 워샤르슈타인 거리를 사용한 두 가지 정의 기반 회귀 알고리즘 도입: CENet(총 변동 거리 사용) 및 WassersteinNet(워샤르슈타인 거리 사용)을 통한 공동 분포 정렬.
- 전역 회귀 손실과 정의 목표를 균형 잡는 미니맥스 최적화 프레임워크 활용, 정의 예산을 제어하는 하이퍼파rameter 포함.
- 제안된 목표 함수의 게임 이론적 최적해 분석을 통해 정의 제약 조건 하에서 모델의 평형 행동 이해.
- 정의 상호 교환의 상한선을 제어하는 정의 상호 교환 파라미터 ε 도입을 통해 정의 vs. 성능의 상호 교환 관계를 체계적으로 분석.
- Adult, COMPAS, Crime, Law, Insurance 등 다섯 가지 벤치마크 데이터셋에 방법 적용, R² 점수와 오차 격차 지표 기반 평가.
실험 결과
연구 질문
- RQ1회귀 모델에서 인구 통계적 하위군 간 정확도 격차의 근본적인 원인은 무엇인가?
- RQ2정확도 격차는 데이터 분포와 관련된 측정 가능한 성분들로 어떻게 수학적으로 분해될 수 있는가?
- RQ3통계적 거리(TV 및 워샤르슈타인)를 사용한 공동 분포 정렬이 회귀에서 정확도 격차를 효과적으로 감소시킬 수 있는가?
- RQ4제안된 프레임워크에서 정의와 예측 성능 사이의 상호 교환 관계는 어떠한가?
- RQ5제안된 알고리즘은 다양한 데이터셋에서 기준 모델 대비 정의성과 모델 정확도 측면에서 어떻게 비교되는가?
주요 결과
- 오차 분해 정리에 따르면, 정확도 격차는 모델이 전역 손실을 최소화하더라도, 가장자리 레이블 분포나 조건부 표현이 인구 통계적 그룹 간 다를 경우 발생함을 밝힘.
- CENet와 WassersteinNet은 모든 다섯 가지 벤치마크 데이터셋에서 정확도 격차를 효과적으로 감소시키며, R² 점수는 유지하거나 약간 향상됨.
- Adult 데이터셋에서 제안된 방법은 ε=0.1일 때 오차 격차(ΔErr)를 0.0612로 낮추며, 경쟁 방법보다 높은 R² 점수 확보.
- COMPAS 데이터셋에서는 CoD 방법 하에서 오차 격차를 0.0085로 감소시키며 R² 점수는 0.1146를 기록하여 강력한 정의-성능 상호 교환 관계 입증.
- 학습 동적 분석 결과, 안정적인 최소화 최적화가 아니더라도 제안된 모델은 표준 MSE 최소화 기반 기준 모델(No Debias)보다 더 작은 오차 격차를 갖는 해에 수렴함.
- 정의 예산 ε가 감소함에 따라 R² 점수와 오차 격차 모두 감소함을 확인하여, 더 엄격한 정의 제약 조건이 격차 감소에 기여함을 확인함. 다만, 수익 감소 효과는 점점 줄어듦.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.