[논문 리뷰] Detoxifying Language Models Risks Marginalizing Minority Voices
이 논문은 언어 모델의 독성 제거 기법이 독성 생성을 줄이기 위해 설계되었지만, 의도하지 않게 정의되지 않은 언어 양식, 특히 아프리카계 미국인 영어(AAE)와 소수자 정체성 언급(MIM)에서의 퍼즐러피티를 증가시키고 생성 품질을 떨어뜨려 공정성에 악영향을 미친다는 것을 입증한다. 핵심 문제는 독성 데이터셋에서 발생하는 비합리적인 상관관계로, AAE와 MIM이 애너테이션 및 샘플링 편향으로 인해 독성 레이블에 과도하게 포함되어 있어, 독성 제거 방법이 이 언어적 특징을 잘못 억제하게 된다.
Language models (LMs) must be both safe and equitable to be responsibly deployed in practice. With safety in mind, numerous detoxification techniques (e.g., Dathathri et al. 2020; Krause et al. 2020) have been proposed to mitigate toxic LM generations. In this work, we show that current detoxification techniques hurt equity: they decrease the utility of LMs on language used by marginalized groups (e.g., African-American English and minority identity mentions). In particular, we perform automatic and human evaluations of text generation quality when LMs are conditioned on inputs with different dialects and group identifiers. We find that detoxification makes LMs more brittle to distribution shift, especially on language used by marginalized groups. We identify that these failures stem from detoxification methods exploiting spurious correlations in toxicity datasets. Overall, our results highlight the tension between the controllability and distributional robustness of LMs.
연구 동기 및 목표
- 언어 모델의 독성 제거 기법이 아프리카계 미국인 영어(AAE)와 소수자 정체성 언급(MIM)과 같은 차별받는 언어 양식에서 성능에 악영향을 미치는지 조사하기.
- 관찰된 성능 저하가 AAE와 MIM을 독성과 혼동하는 독성 데이터셋의 비합리적인 상관관계 때문인지 분석하기.
- 다양한 방언과 정체성 표시어에서 모델의 유용성에 영향을 미치는 독성 제거 강도의 영향 평가하기.
- 편향된 독성 제거가 실제 NLP 배포 환경에서 나타나는 표현적 피해와 낙인화 위험을 부각하기.
제안 방법
- 연구는 네 가지 최신 독성 제거 기법을 사용한다: 도메인 적응 미리 훈련(DAPT), 플러그 앤 플레이 언어 모델(PPLM), GeDi, 그리고 독성 분류기로 출력 필터링.
- 모든 방법은 저합의도 예제를 걸러낸 후 Jigsaw Civil Comments 데이터셋에 맞추어 미세조정된 GPT-2 미디엄 모델에 적용된다.
- AAE 또는 MIM이 포함된 프롬프트와 WAE(화이트-에일리언드 영어)를 대비하여 퍼즐러피티를 측정하며, 독성 제거 강도 수준 간 비교를 수행한다.
- 인간 평가를 통해 커뮤니티 워커를 활용해 WAE와 AAE 프롬프트에서 생성된 완성문의 유창성, 스타일, 주제 일관성 평가한다.
- 분석 결과, 독성 데이터셋이 애너테이션 및 샘플링 편향으로 인해 AAE/MIM과 독성 레이블 간 비합리적인 상관관계를 포함하고 있음을 확인한다.
- GeDi의 ω와 같은 초모델 하이퍼파라미터를 변화시켜 독성 제거 강도를 높일수록 AAE 및 MIM에서 성능 저하가 심화됨을 입증한다.
실험 결과
연구 질문
- RQ1언어 모델의 독성 제거가 화이트-에일리언드 영어(WAE)에 비해 아프리카계 미국인 영어(AAE)와 소수자 정체성 언급(MIM)에서 퍼즐러피티를 비례적으로 증가시키는가?
- RQ2독성 제거 강도를 높일수록 AAE 및 MIM에서 성능 저하가 얼마나 악화되는가?
- RQ3독성 데이터셋의 비합리적인 상관관계가 독성 제거 방법이 AAE 및 MIM을 억제하게 만드는 데 어떤 역할을 하는가?
- RQ4AAE 프롬프트에 기반해 텍스트를 생성할 때 인간 평가에서 독성 제거된 모델의 성능은 WAE 프롬프트와 어떻게 다른가?
- RQ5소수자 언어 정체성을 간과하는 독성 제거된 모델을 배포할 경우 발생하는 표현적 피해와 사회적 피해는 무엇인가?
주요 결과
- 독성 제거 기법은 AAE 및 MIM 텍스트에서 퍼즐러피티를 크게 증가시키며, 기본 모델조차도 AAE에서 WAE 대비 약 3배 높은 퍼즐러피티를 보인다.
- 강한 독성 제거(예: GeDi에서 높은 ω)를 적용할 경우, AAE에서의 퍼즐러피티는 WAE 대비 거의 400배로 증가하여 유용성에 심각한 손상을 입힌다.
- 인간 평가 결과, 독성 제거된 모델은 WAE 프롬프트에 비해 AAE 프롬프트에서 생성한 텍스트의 유창성, 스타일, 주제 일관성을 유지하지 못함을 확인했다.
- 성능 저하는 한 가지 독성 제거 방법에 국한되지 않고 DAPT, PPLM, GeDi, 필터링 전반에 걸쳐 일관되게 관찰되어, 편향된 데이터에 뿌리를 둔 체계적 문제임을 시사한다.
- 애너테이션 편향(예: AAE를 잘못 독성으로 레이블링)과 샘플링 편향(예: 독성 댓글이 흔히 소수자 집단을 대상으로 함)으로 인해 독성 데이터셋에 AAE/MIM과 독성 간 비합리적인 상관관계가 존재함을 확인했다.
- 독성 제거 강도를 높일수록 편향이 악화됨을 확인하여, 문제의 원인이 부작용이 아니라 현재의 독성 제거 파이프라인에 내재된 구조적 결함임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.