[논문 리뷰] Characterizing Fairness Over the Set of Good Models Under Selective Labels
이 논문은 선택적 레이블링 하에서 성능이 뛰어난 모델들(즉, '라슈문 집합') 전반에 걸쳐 예측의 공정성을 분석하기 위한 FaiRS 프레임워크를 소개한다. 이는 성능을 유지하면서 공정성 편차가 최소화된 모델을 식별함으로써 감사 및 모델 교체를 가능하게 하며, 신용 평가 및 재범 예측 데이터셋에서 정확도를 희생시키지 않고도 공정성을 향상시킴으로써 효과성을 입증한다.
Algorithmic risk assessments are used to inform decisions in a wide variety of high-stakes settings. Often multiple predictive models deliver similar overall performance but differ markedly in their predictions for individual cases, an empirical phenomenon known as the "Rashomon Effect." These models may have different properties over various groups, and therefore have different predictive fairness properties. We develop a framework for characterizing predictive fairness properties over the set of models that deliver similar overall performance, or "the set of good models." Our framework addresses the empirically relevant challenge of selectively labelled data in the setting where the selection decision and outcome are unconfounded given the observed data features. Our framework can be used to 1) replace an existing model with one that has better fairness properties; or 2) audit for predictive bias. We illustrate these uses cases on a real-world credit-scoring task and a recidivism prediction task.
연구 동기 및 목표
- 다양한 모델들 간의 총 정확도 측면에서 유사한 성능을 보이는 모델들 사이에서 예측의 공정성을 평가하기 위한 프레임워크를 개발하는 것.
- 특정 케이스에 대해서만 결과가 관찰되는 선택적 레이블링 데이터에서, 특징에 조건부로 비편향성(uncounfoundedness)이 보장될 때의 도전 과제를 해결하는 것.
- 기존 모델을 성능을 유지하면서 더 나은 공정성 특성을 가진 모델로 교체할 수 있도록 실무자들이 가능하게 하는 것.
- 감사자가 현재 모델이 '사업의 필요성'에 기반해 정당화될 수 있는지 평가하기 위해, 양호한 성능을 보이는 모델 집합 내에서 더 공정한 대안이 존재하는지 확인할 수 있도록 지원하는 것.
- 단일 모델을 넘어서 전체 성능이 유사한 모델 집합에 걸쳐 공정성 분석을 확장하여, 공정성 결과에서의 라슈문 효과(Rashomon Effect)를 포괄하는 것.
제안 방법
- FaiRS는 기준 모델의 성능 허용 오차 내에서 성능을 갖는 모델 집합에 대해 최적화 문제로 공정한 모델을 탐색한다.
- 선형 프로그래밍 감소 기법을 사용하여 주어진 공정성 측정 기준에 대해 그룹 간 예측 편차의 최소 및 최대값을 계산한다.
- 기준 모델의 성능 허용 오차 내에 있도록 보장하기 위해 총 손실에 대한 제약 조건을 통합한다.
- 선택적 레이블링을 위해, 이론적 보장을 유지하기 위해 결과 회귀 함수에 오라클 액세스를 사용하는 FaiRS의 변형을 제안한다.
- 분류 및 회귀 작업 모두를 지원하며, 통상적인 공정성 지표(예: 통계적 평등성, 양성/음성 클래스의 균형)를 사용한다.
- 유사한 총 성능를 갖는 모델들 사이에서 공정성 결과의 범위를 탐색함으로써 라슈문 효과를 활용한다.
실험 결과
연구 질문
- RQ1기준 모델의 성능과 유사한 성능을 보이는 모델들 사이에서 달성 가능한 예측 편차의 범위는 무엇인가?
- RQ2기준 모델보다 유의미하게 낮은 예측 편차를 달성하는 모델이 양호한 성능의 모델 집합 내에 존재하는가?
- RQ3기존 모델의 선택을 '사업의 필요성'에 기반해 정당화할 수 있도록, 현재 모델와 유사한 성능을 유지하면서 더 공정한 모델을 식별할 수 있는가?
- RQ4결과가 모든 개인에게 관찰되지 않는 선택적 레이블링 데이터 설정에서 이 프레임워크는 어떻게 작동하는가?
- RQ5실제 응용 분야인 신용 평가 및 재범 예측에서 전체 예측 정확도를 희생시키지 않고 얼마나 공정성을 향상시킬 수 있는가?
주요 결과
- COMPAS 재범 예측 데이터셋에서 FaiRS는 기준 모델이 블랙 및 화이트 피고인 간에 라슈문 집합 내의 모든 모델보다 더 큰 예측 편차를 생성한다는 것을 발견했다.
- 라슈문 집합 내에서 편차를 최소화하는 모델은 통계적 평등성 편차를 0.200(제안된 COMPAS 모델)에서 -0.207로 감소시켰으며, 테스트 손실은 유사하게 유지되었다(0.098 대 0.102).
- 신용 평가 작업에서는 FaiRS가 기준 모델보다 더 낮은 예측 편차를 가진 모델를 식별했으며, 테스트 손실은 0.096을 기록하여 기준 모델의 0.102에 비해 3% 이내였다.
- 커뮤니티와 범죄 회귀 작업에서는 다수의 백인 및 비백인 지역 간 예측 폭력 범죄율의 편차를 기준 모델의 -0.3386에서 FaiRS가 -0.2658로 감소시켰으며, 테스트 손실은 6.9% 증가(0.0108 대 0.0101)에 그쳤다.
- 결과 회귀 함수에 오라클 액세스를 사용할 경우, 선택적 레이블링 하에서도 일반화 오차와 예측 편차에 대한 이론적 보장을 유지한다.
- 결과는 성능 희생 없이도 공정성 향상이 종종 가능함을 시사하며, 이는 기존 모델의 '사업의 필요성'에 기반한 정당화를 도전한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.