[논문 리뷰] Removing biased data to improve fairness and accuracy
이 논문은 영향 함수를 사용해 차별적인 예측을 유발하는 원인으로 지목된 훈련 데이터 포인트를 식별하고 제거함으로써, 기계학습에서 정확도와 공정성의 향상을 위한 블랙박스 사전처리 방법을 제안한다. 이 방법은 개인 차별을 거의 제로 수준으로 줄이며, 여섯 개의 실제 세계 데이터셋에서 모델 정확도를 향상시킨다.
Machine learning systems are often trained using data collected from historical decisions. If past decisions were biased, then automated systems that learn from historical data will also be biased. We propose a black-box approach to identify and remove biased training data. Machine learning models trained on such debiased data (a subset of the original training data) have low individual discrimination, often 0%. These models also have greater accuracy and lower statistical disparity than models trained on the full historical data. We evaluated our methodology in experiments using 6 real-world datasets. Our approach outperformed seven previous approaches in terms of individual discrimination and accuracy.
연구 동기 및 목표
- 과거의 차별적 결정을 반영한 역사적 데이터를 기반으로 훈련된 기계학습 모델에서 퍼지게 퍼진 편향 문제를 다루기.
- 특히 고위험 응용 분야인 채용, 대출, 형사 사법에서 정확도를 훼손하지 않으면서 모델 예측의 개인적 차별을 줄이기.
- 모델 아키텍처나 기울기 접근이 불가능한 블랙박스 모델에 적용 가능한 사전처리 기법을 개발하기.
- 일반적으로 공정성 기법에서 나타나는 정확도와의 트레이드오프와는 반대로, 개인적 차별과 통계적 편향 지표를 동시에 개선하면서 테스트 정확도를 높이기.
제안 방법
- 차별적 쌍 생성: 민감한 특성 외 나머지가 동일한 유사한 개인들(다른 민감 특성만 다름)이 모델에 의해 다를 바 있는 예측을 받는지 식별하기.
- 각 훈련 데이터 포인트가 차별적 쌍에 대해 내린 다를 예측에 기여하는 정도를 영향 함수를 통해 측정하기.
- 차별적 예측에 기여하는 정도에 따라 훈련 데이터 포인트를 순위 매기기, 특히 불공정한 결과를 유발하는 데 가장 기여한 포인트를 우선순위로 정하기.
- 가장 영향력이 높은 상위-k개의 데이터 포인트(차별의 원인이 되는 포인트들)를 제거하여 편향 제거된 훈련 데이터셋을 구성하기.
- 청소된 데이터셋으로 모델을 재학습시켜 더 공정하고 정확한 모델을 도출하기.
- 모델의 학습 및 예측 기능 외에는 접근이 불필요한 블랙박스 접근 방식을 사용하여, 기업 소유 모델에도 적용 가능하게 하기.
실험 결과
연구 질문
- RQ1차별적 예측을 일으키는 가장 영향력 있는 훈련 데이터 포인트를 식별하고 제거함으로써, 정확도를 희생시키지 않고도 공정성을 향상시킬 수 있는가?
- RQ2기존의 공정성 기법과 비교했을 때, 제안된 방법은 개인적 차별, 통계적 편향, 테스트 정확도 측면에서 어떻게 성능을 내는가?
- RQ3편향 제거를 통해 개인적 차별을 거의 제로 수준으로 낮추면서 동시에 모델 정확도를 높일 수 있는가?
- RQ4모델 아키텍처에 대한 접근이 없이도 영향 함수가 블랙박스 모델 내에서 편향된 훈련 인스턴스를 효과적으로 식별할 수 있는가?
- RQ5기존의 사전처리, 내재 처리, 후처리 방법과 비교했을 때, 영향력 있는 편향된 데이터 포인트를 제거함으로써 더 나은 공정성-정확도 트레이드오프를 달성할 수 있는가?
주요 결과
- 제안된 방법은 대부분의 실험에서 개인적 차별을 0%로 줄였으며, 이는 이전의 일곱 가지 접근 방식을 크게 앞서는 성능이다.
- 편향 제거된 데이터셋으로 학습된 모델은 여덟 번의 실험 전반에서 전체 역사적 데이터셋으로 학습된 베이스라인 모델보다 더 높은 테스트 정확도를 달성했다.
- 이 방법은 일반적으로 공정성과 정확도 사이의 트레이드오프를 수반하는 대부분의 이전 접근 방식과는 달리, 개인적 차별과 통계적 편향 지표를 동시에 향상시켰다.
- 이 기법은 신용, 채용, 형사 사법과 같은 다양한 실제 세계 데이터셋에서 효과적으로 작동했다.
- 시험한 여덟 가지 방법 중에서 유일하게 최적화 목표에 관계없이 개인적 차별, 통계적 편향, 정확도 세 가지 지표를 일관되게 향상시킨 방법이었다.
- 영향 함수는 재학습이 필요 없이도 불공정한 예측에 가장 기여한 훈련 데이터 포인트를 효과적으로 식별하여 타겟된 제거를 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.