Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring and Reducing Gendered Correlations in Pre-trained Models

Kellie Webster, Xuezhi Wang|arXiv (Cornell University)|2020. 10. 12.
Ethics and Social Impacts of AI참고 문헌 47인용 수 106
한 줄 요약

이 논문은 사전 학습된 모델에서 성별 편향된 상관을 감지하기 위한 지표를 제시하고, 유사한 정확도를 가진 모델이라도 상관 수준이 크게 다를 수 있음을 보이며, 상관을 감소시키되 정확도는 보존하는 완화 방법들(드롭아웃과 counterfactual data augmentation)을 시연하고, 미세 조정 이후에도 효과가 지속됨을 보여준다.

ABSTRACT

Pre-trained models have revolutionized natural language understanding. However, researchers have found they can encode artifacts undesired in many applications, such as professions correlating with one gender more than another. We explore such gendered correlations as a case study for how to address unintended correlations in pre-trained models. We define metrics and reveal that it is possible for models with similar accuracy to encode correlations at very different rates. We show how measured correlations can be reduced with general-purpose techniques, and highlight the trade offs different strategies have. With these results, we make recommendations for training robust models: (1) carefully evaluate unintended correlations, (2) be mindful of seemingly innocuous configuration differences, and (3) focus on general mitigations.

연구 동기 및 목표

  • 사전 학습된 모델과 다운스트림 작업에서 성별 편향 상관을 감지하기 위한 프레임워크와 지표를 정의한다.
  • 유사한 정확도를 가진 모델이라도 성별 편향 상관의 수준이 다양할 수 있음을 보여준다.
  • 완화 전략(드롭아웃 정규화 및 counterfactual data augmentation)의 평가와 그 트레이드오프를 분석한다.
  • 미세 조정 이전의 완화가 다운스트림 작업으로 이어져 재학습된 상관에 대한 내성을 강화하는지 보여준다.

제안 방법

  • 성별 편향 상관에 대해 Innate(DisCo) 및 Extrinsic(Coref, STS-B, Bias-in-Bios) 지표를 포함하는 다중 지표 평가 프레임워크를 제안한다.
  • 템플릿 기반 텍스트와 생성 기반 텍스트를 결합한 내재적 DisCo 분석을 개발하여 상관을 발견한다.
  • 미세 조정 후 실제로 상관을 평가하기 위해 표준 다운스트림 작업(Coref, STS-B, Bias-in-Bios)을 사용한다.
  • 정확도와 무관하게 상관 수준을 비교하기 위해 모델 변형(BERT, ALBERT; 다양한 크기)을 실험한다.
  • 두 가지 일반적인 완화 기법을 적용한다: (i) pre-training 중의 dropout 정규화, (ii) pre-training 중의 counterfactual data augmentation (CDA), 2-sided augmentation을 포함하여.

실험 결과

연구 질문

  • RQ1유사한 정확도를 가진 사전 학습 모델이 서로 다른 속도로 성별 편향 상관을 암호화(인코딩)하는가?
  • RQ2일반 목적의 완화가 다운스트림 작업 성능을 해치지 않으면서 성별 편향 상관을 줄일 수 있는가?
  • RQ3사전 학습에서의 완화가 미세 조정으로 이어지며 상관의 재학습을 저해하는가?
  • RQ4상관 감소를 위한 dropout과 counterfactual data augmentation 간의 트레이드오프는 무엇인가?

주요 결과

  • 유사한 정확도를 가진 모델은 (예: coreference, STS-B, Bias-in-Bios)에서 성별 편향 상관 지표에 큰 차이를 보일 수 있다.
  • 드롭아웃 정규화는 여러 지표에서 성별 편향 상관을 감소시키며 많은 설정에서 상당한 정확도 손실 없이 작동하지만, 지나치게 높은 드롭아웃은 coreference와 같은 일부 작업에 손상을 줄 수 있다.
  • Counterfactual data augmentation (CDA)는 상관을 효과적으로 감소시키며 종종 전체 정확도에 미치는 영향이 적고 증강 용어를 넘어서 일반화될 수 있다.
  • pre-training에서의 완화는 미세 조정 동안 상관의 재학습에 대한 회복력을 부여하고, 부분적으로 동결된 완화 모델은 특정 조건에서 정확도를 유지하면서 더 낮은 상관을 보존한다.
  • BERT와 ALBERT는 서로 다른 기준 상관 수준을 보이며, 단일 아키텍처/크기가 보편적으로 상관를 최소화하지 않는다; 정밀하고 다중 지표 평가가 권장된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.