[논문 리뷰] Fair Infinitesimal Jackknife: Mitigating the Influence of Biased Training Data Points Without Refitting
이 논문은 사전 훈련된 분류기의 공정성을 향상시키기 위해 훈련 데이터 포인트 중 그룹 공정성 지표에 비례적으로 큰 영향을 미치는 포인트를 식별하고 약간의 영향을 제거하는 후처리 방법 Fair Infinitesimal Jackknife (Fair-IJ)을 제안한다. 이는 모델 재학습 없이도 안정적이고 효율적인 영향도 추정 기법인 IHVP-WoodFisher 방법을 통해 실현되며, 예측 정확도를 유지하면서도 민감도 기반 공정성 지표인 인구 구성 비율 및 기회 평등성의 불균형을 크게 감소시킨다.
In consequential decision-making applications, mitigating unwanted biases in machine learning models that yield systematic disadvantage to members of groups delineated by sensitive attributes such as race and gender is one key intervention to strive for equity. Focusing on demographic parity and equality of opportunity, in this paper we propose an algorithm that improves the fairness of a pre-trained classifier by simply dropping carefully selected training data points. We select instances based on their influence on the fairness metric of interest, computed using an infinitesimal jackknife-based approach. The dropping of training points is done in principle, but in practice does not require the model to be refit. Crucially, we find that such an intervention does not substantially reduce the predictive performance of the model but drastically improves the fairness metric. Through careful experiments, we evaluate the effectiveness of the proposed approach on diverse tasks and find that it consistently improves upon existing alternatives.
연구 동기 및 목표
- 재학습이 비용이나 모델 크기로 인해 불가능한 상황에서 재학습 없이 고위험 기계학습 결정의 공정성을 해결하는 것.
- 테스트 시점 예측을 수정하는 대신 영향력 있는 훈련 인스턴스를 대상으로 하여 편향을 완화하는 후처리 방법을 개발하는 것.
- 전체 미세조정 없이도 BERT와 같은 대규모 모델에서 효율적인 영향도 추정을 통해 공정성 향상을 가능하게 하는 것.
- 그룹 공정성 지표인 인구 구성 비율 및 기회 평등성과 같은 지표를 크게 감소시키면서도 높은 예측 성능를 유지하는 것.
제안 방법
- 모든 훈련 인스턴스가 민감도 기반 공정성 지표인 인구 구성 비율 및 기회 평등성에 미치는 영향을 영향도 함수를 통해 추정한다.
- 특정 공정성 지표에 대한 각 훈련 포인트의 영향도를 미세한 잭나이프 근사법을 통해 계산한다.
- 비용이 많이 드는 헤시안 역행렬 계산을 피하기 위해 안정적이고 효율적인 역헤시안-벡터곱을 계산하기 위해 새로운 IHVP-WoodFisher 방법을 개발한다.
- 가장 불공정하게 영향력이 큰 훈련 인스턴스를 식별하고 약간의 영향을 제거하여 그룹 공정성에 대한 영향을 줄인다.
- 모델 학습 후 적용되며 모델 재학습이 필요 없어 BERT와 같은 대규모 모델에서도 사용 가능하다.
- 오직 소수의 트리거 토큰만 최적화되는 프ompt-tuning을 통해 복잡한 모odalities인 NLP에도 적응 가능하다.
실험 결과
연구 질문
- RQ1선택적 훈련 데이터 포인트 제거를 통해 재학습 없이 사전 훈련된 모델의 공정성을 향상시킬 수 있는가?
- RQ2대규모 모델에서 공정성 지표에 대한 훈련 인스턴스의 영향도를 효율적이고 안정적으로 계산할 수 있는가?
- RQ3높은 영향력의 편향된 데이터 포인트를 제거하면 기존 후처리 방법보다 더 나은 공정성-정확도 트레이드오프를 달성할 수 있는가?
- RQ4프롬프트 테이닝과 같은 파rameter 효율적 튜닝 기법을 사용해도 대규모 사전 훈련된 언어 모델에 효과적으로 적용 가능한가?
주요 결과
- Adult 데이터셋에서 Fair-IJ는 정확도 손실이 크지 않은 상태에서 인구 구성 비율을 0.18에서 0.01로 감소시켰다.
- Coverage 데이터셋에서 Fair-IJ 적용 후 인구 구성 비율이 0.22에서 0.01로 개선되었다.
- 민족적 소수자로 Muslim을 민감 속성으로 삼은 CivilComments 데이터셋에서, BERT TT=4일 때 인구 구성 비율은 기준선 0.268에서 0.042로 감소했고, BERT TT=10일 땐 0.254에서 0.089로 감소했다.
- Fair-IJ는 모든 테스트된 BERT 변종에서 ERM 및 Gap Regularization보다 공정성 향상에서 뛰어난 성능를 보였으며, 균형 정확도를 유지하거나 향상시켰다.
- 단 몇 개의 학습 가능한 트리거 토큰만 있는 프롬프트 테이닝된 BERT 모델에 적용해도 상당한 공정성 향상을 달성했다.
- IHVP-WoodFisher 근사법은 안정적이고 효율적이었으며, 제약적인 곡률 가정 없이도 대규모 모델에서 확장 가능한 영향도 추정을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.