Skip to main content
QUICK REVIEW

[논문 리뷰] Perturbation Augmentation for Fairer NLP

Rebecca Qian, Candace Ross|arXiv (Cornell University)|2022. 05. 25.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 98,000건의 민족적 배경 텍스트 변형을 포함한 대규모 인간 주석 데이터셋(PANDA)을 기반으로 훈련된 신경망 기반의 변형 모델을 소개하여 NLP에서의 공정성 향상에 기여한다. 성별, 인종 등 다양한 민족적 배경 요소를 교환하는 방식의 데이터 증강(예: '여성' → '남성')을 통해 사전 훈련 단계(FairBERTa) 및 미세조정 단계(fairtuning)에서 모델의 공정성을 향상시키며, 성능 저하 없이도 공정성을 개선하였으며, 이는 새로운 지표인 fairscore를 통해 검증되었다. fairscore는 민족적 배경 변형에 대한 모델의 저항력을 측정한다.

ABSTRACT

Unwanted and often harmful social biases are becoming ever more salient in NLP research, affecting both models and datasets. In this work, we ask whether training on demographically perturbed data leads to fairer language models. We collect a large dataset of human annotated text perturbations and train a neural perturbation model, which we show outperforms heuristic alternatives. We find that (i) language models (LMs) pre-trained on demographically perturbed corpora are typically more fair, and (ii) LMs finetuned on perturbed GLUE datasets exhibit less demographic bias on downstream tasks, and (iii) fairness improvements do not come at the expense of performance on downstream tasks. Lastly, we discuss outstanding questions about how best to evaluate the (un)fairness of large language models. We hope that this exploration of neural demographic perturbation will help drive more improvement towards fairer NLP.

연구 동기 및 목표

  • 훈련 데이터에 반영된 유해한 연관성을 반복하고 악화시키는 NLP 모델의 사회적 편향 문제에 대응하기 위해.
  • 규칙 기반 민족적 배경 변형 방법의 한계를 극복하기 위해, 이는 경직되고 자연스럽지 않은 텍스트를 생성하기 때문이다.
  • 대규모 인간 주석 데이터셋 기반의 민족적 배경 텍스트 변형을 훈련한 신경망 기반의 제어 가능한 변형 모델을 개발하기 위해.
  • 민족적 배경 증강이 사전 훈련 및 미세조정 단계에서 언어 모델의 공정성에 미치는 영향을 평가하기 위해.
  • 민족적 배경 변화에 대한 저항력으로서의 공정성 측정을 위한 외재적 지표인 fairscore를 제안하기 위해.

제안 방법

  • 다양한 민족적 배경 축(예: 성별, 인종 등)에 걸쳐 98,000건의 인간이 생성한 민족적 배경 변형을 주석하여 PANDA 데이터셋을 구축한다.
  • 민족적 용어를 대상 속성으로 교체하여 의미가 유지된 고품질의 변형 텍스트를 생성하기 위해 시퀀스-투-시퀀스 신경망 모델(변형 모델)을 훈련한다.
  • 민족적 배경 변형이 적용된 예제를 포함한 코퍼스를 기반으로 대규모 언어 모델 FairBERTa를 사전 훈련하여 사전 훈련 단계에서 민족적 편향을 감소시킨다.
  • GLUE 데이터셋을 민족적 배경 변형 증강된 데이터로 변형하여 'fairtuning'이라는 방법으로 기존 모델을 미세조정함으로써, 최종 작업에서의 공정성을 향상시킨다.
  • 원본 입력과 변형된 입력 간의 모델 예측 변화를 계산하여 민족적 배경 변화에 대한 저항력을 정량화하는 외재적 공정성 지표인 fairscore를 제안한다.

실험 결과

연구 질문

  • RQ1신경망 기반 민족적 배경 변형이 성능 저하 없이 사전 훈련된 언어 모델의 공정성을 향상시킬 수 있는가?
  • RQ2변형 증강된 데이터셋으로 미세조정하는 것(fairtuning)이 최종 NLU 작업에서 민족적 편향을 감소시키는가?
  • RQ3제안된 fairscore 지표는 다양한 NLP 작업에서 민족적 배경 변형에 대한 저항력으로서의 공정성을 얼마나 효과적으로 측정하는가?
  • RQ4표준 NLU 데이터셋에서 민족적 배경 변형이 원래 정답 레이블에 얼마나 영향을 미치는가?
  • RQ5대규모 인간 주석 변형 데이터셋(PANDA)을 통해 히우리스틱 규칙 기반 시스템보다 더 높은 품질의 신경망 변형 모델을 훈련시킬 수 있는가?

주요 결과

  • 민족적 배경 변형이 적용된 코퍼스를 기반으로 사전 훈련된 언어 모델(FairBERTa)은 최종 작업에서 성능 저하 없이 유의미하게 공정성이 향상된다.
  • 변형 증강된 GLUE 데이터셋으로 미세조정된 모델(fairtuning)은 원본 데이터로 미세조정된 모델보다 평균적으로 더 공정하다.
  • 인간 평가를 통해 신경망 변형 모델이 히우리스틱 대비 자연스럽고 의미가 유지된 변형 텍스트를 더 잘 생성하는 것으로 확인되었다.
  • fairscore 지표는 민족적 배경 변형에 대한 저항력으로서의 공정성을 성공적으로 정량화하였으며, 여러 GLUE 작업에서 fairtuning 이후 유의미한 향상가능성을 보였다.
  • 초기 검증 결과, 각 작업당 평균 25개 예제 중 약 4~5개(약 16~20%)만이 변형 후 레이블 불일치를 보였으며, 이는 대부분의 경우 레이블 불변성 가정이 유지됨을 시사한다.
  • 본 연구는 신경망 기반 민족적 배경 변형을 통한 데이터 수준 증강 전략이 NLP 모델의 편향 감소에 실현 가능하고 효과적인 방법임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.