Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluation of African American Language Bias in Natural Language Generation

Nicholas Deas, Jessi Grieser|arXiv (Cornell University)|2023. 05. 23.
Text Readability and Simplification인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 아프리카계 미국어(African American Language, AAL)에 대해 보이는 편향을 두 가지 작업—대응 생성과 마스킹 스펙트럼 예측—을 통해 평가한다. 새로 제작한 다중 맥락 AAL 데이터셋을 사용하여, 저자들은 LLMs가 AAL에 대해 WME(백인 주류 영어)보다 더 어려움을 겪는 뚜렷한 성능 격차를 발견한다. 이는 생성 모델에서 어원적 편향이 존재함을 시사한다.

ABSTRACT

We evaluate how well LLMs understand African American Language (AAL) in comparison to their performance on White Mainstream English (WME), the encouraged "standard" form of English taught in American classrooms. We measure LLM performance using automatic metrics and human judgments for two tasks: a counterpart generation task, where a model generates AAL (or WME) given WME (or AAL), and a masked span prediction (MSP) task, where models predict a phrase that was removed from their input. Our contributions include: (1) evaluation of six pre-trained, large language models on the two language generation tasks; (2) a novel dataset of AAL text from multiple contexts (social media, hip-hop lyrics, focus groups, and linguistic interviews) with human-annotated counterparts in WME; and (3) documentation of model performance gaps that suggest bias and identification of trends in lack of understanding of AAL features.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)이 아프리카계 미국어(African American Language, AAL)를 백인 주류 영어(White Mainstream English, WME)와 비교해 이해하고 생성하는 데 편향을 보이는지 조사하는 것.
  • 새로운 다양성 있는 AAL 데이터셋을 사용하여 LLMs를 대응 생성 및 마스킹 스펙트럼 예측이라는 두 가지 언어 생성 작업에서 평가하는 것.
  • 특히 생략된 수동어 및 습관적 be와 같은 AAL 특징을 해석하고 생성하는 데 어려움을 겪는 성능 격차를 기록하여, 어원적 편향이 있음을 드러내는 것.
  • 감시와 같은 고위험 응용 분야에서의 잠재적 오용 가능성을 경고하면서도, 헬스케어 및 정신건강과 같은 고영향력 응용 분야에서 모델의 포괄성 향상을 주장하는 것.

제안 방법

  • 소셜 미디어, 힙합 가사, 포커스 그룹, 언어학적 인터뷰에서 유래한 AAL 텍스트로 구성된 새로운 데이터셋을 구축하였으며, 인간이 수작업으로 WME 대응어를 기입하였다.
  • 다섯 개의 사전 학습된 LLMs를 대응 생성 작업에서 평가하여, AAL과 WME 간 번역 능력을 통해 어원적 이해도를 측정하였다.
  • 마스킹 스펙트럼 예측(Masked Span Prediction, MSP) 작업을 적용하여, AAL 및 WME 맥락에서 누락된 구절을 예측할 수 있는 능력을 테스트하였다.
  • 자동 평가 지표와 인간 평가를 병행하여 성능을 평가하였으며, 정확도와 어원적 특징 유지 여부에 중점을 두었다.
  • 오류 분석을 통해 모델이 끊어진 수동어와 시제 표시어 등 특정 AAL 형태구문 특징에서 끊임없이 실패하는 것을 확인하였다.
  • 편향된 모델에 의존하지 않기 위해 독립된 어휘 기반 접근법을 사용하여 독성 평가를 수행하여 기존 편향을 강화하는 것을 방지하였다.

실험 결과

연구 질문

  • RQ1대규모 언어 모델(Large Language Models, LLMs)은 아프리카계 미국어(African American Language, AAL)를 백인 주류 영어(White Mainstream English, WME)와 비교해 생성하고 이해하는 데 성능 격차를 보이는가?
  • RQ2LLMs가 가장 자주 잘못 이해하거나 잘못 생성하는 AAL의 특정 형태구문 특징은 무엇인가? (예: 끊어진 수동어, 습관적 be)
  • RQ3소셜 미디어, 음악, 포커스 그룹 등 AAL 사용의 다양한 맥락에서 LLM의 성능은 어떻게 달라지는가?
  • RQ4LLMs가 AAL과 WME 간 번역 시 의미 동등성을 얼마나 잘 유지하는가?
  • RQ5AAL를 더 잘 이해하는 LLMs가 감시 및 고위험 응용 분야에서 윤리적 위험을 초래할 가능성은 어느 정도인가?

주요 결과

  • 평가된 여섯 개의 모든 모델에서 AAL 이해 및 생성 능력에 있어 WME 대비 뚜렷한 성능 격차가 나타나며, 이는 일관된 열등성으로 나타났다.
  • 모델들은 끊어진 수동어(예: 'she at work')나 습관적 be(예: 'he be running')와 같은 핵심 AAL 특징을 자주 유지하지 못해 어원적 이해도가 떨어지는 것으로 나타났다.
  • 오류 분석 결과, 모델들이 AAL 특징을 WME 형태로 과도하게 수정하는 경향이 있어 표준화 경향에 편향되어 있음을 시사한다.
  • 마스킹 스펙트럼 예측 작업을 통해 모델이 비표준 문법과 어휘 선택을 포함한 맥락에 적합한 AAL 어휘를 예측하는 데 어려움을 겪는 것으로 확인되었다.
  • 특히 힙합 가사나 포커스 그룹 토론처럼 복잡하고 맥락적으로 뉘앙스가 중요한 AAL에서는 성능 격차가 더 뚜렷했다. 여기서 미세한 언어적 신호가 의미적 무게를 지녔다.
  • 현재 평가 지표가 자체적으로 편향을 내재하고 있을 수 있음을 드러내었으며, 어휘 기반 및 모델 기반 측정법이 AAL를 독성 또는 잘못된 것으로 잘못 분류하여 체계적 불평등을 강화할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.