Skip to main content
QUICK REVIEW

[논문 리뷰] WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models

Virginia K. Felkner, Ho-Chun Herbert Chang|arXiv (Cornell University)|2023. 06. 26.
Hate Speech and Cyberbullying Detection인용 수 5
한 줄 요약

WinoQueer는 레즈비언·게이·비이성애자·퀴어·아젠더 등 성소수자 커뮤니티에서 유래한 설문 기반의 스테레오타입 템플릿을 활용해 대규모 언어모델(LLM) 내 성소수자에 대한 편견을 측정하기 위한 커뮤니티 인-더-루프 벤치마크를 제안한다. 이는 다양한 LLM에서 뚜렷한 반퀴어 편견이 존재함을 드러내며, 특히 소셜미디어 글과 같은 커뮤니티가 생성한 콘텐츠로 미세조정(fine-tuning)할 경우 이러한 편견을 줄일 수 있음을 보여준다.

ABSTRACT

We present WinoQueer: a benchmark specifically designed to measure whether large language models (LLMs) encode biases that are harmful to the LGBTQ+ community. The benchmark is community-sourced, via application of a novel method that generates a bias benchmark from a community survey. We apply our benchmark to several popular LLMs and find that off-the-shelf models generally do exhibit considerable anti-queer bias. Finally, we show that LLM bias against a marginalized community can be somewhat mitigated by finetuning on data written about or by members of that community, and that social media text written by community members is more effective than news text written about the community by non-members. Our method for community-in-the-loop benchmark development provides a blueprint for future researchers to develop community-driven, harms-grounded LLM benchmarks for other marginalized communities. Note: This version corrects a bug found in evaluation code after publication. General findings have not changed, but tables 5 and 6 and figure 1 have been corrected.

연구 동기 및 목표

  • 성소수자 커뮤니티가 실제로 겪는 현실적 피해를 기반으로 한 벤치마크가 부족한 점을 보완하기 위해 LLM 편견 평가에 있어 실제 경험을 반영한 기준이 필요하다는 점을 다루기 위해.
  • 성소수자 개인의 삶의 경험과 자가 보고한 스테레오타입을 중심으로 한 편견 평가 프레임워크를 개발하기 위해.
  • 성소수자 커뮤니티가 만든 콘텐츠 또는 그에 관한 콘텐츠로 LLM을 미세조정하면 반퀴어 편견을 줄일 수 있는지 조사하기 위해.
  • 다른 소수자 정체성을 위한 편견 벤치마크를 구축하기 위한 확장 가능한 커뮤니티 주도의 방법론을 만들기 위해.
  • 기존의 벤치마크가 성소수자 커뮤니티 내에서의 교차 정체성 및 비이원성 정체성을 충분히 반영하지 못하고 있음을 부각하기 위해.

제안 방법

  • 성소수자 개인을 대상으로 설문 조사를 실시하여, 흔히 존재하고 해로운 반성소수자 스테레오타입을 특정하는 새로운 커뮤니티 인-더-루프 방법을 개발하였다.
  • 설문 응답을 바탕으로 문장 템플릿을 생성하고, 이를 윈오그라드 스타일의 공호성 작업에 통합하여 모델 예측을 테스트하였다.
  • 서로 다른 9개의 성소수자 정체성 하위군을 포함하여 WinoQueer 벤치마크를 구축하였으며, 성별, 성적 지향, 문화적 배경을 반영한 서구 중심의 이성애자 및 비성전환자 기준의 대명사와 이름을 사용하였다.
  • 모델의 예측에서의 편견을 측정하기 위해 맞춤형 스코어 함수를 사용하여 7종의 유명한 LLM(BERT, RoBERTa, ALBERT, BART, GPT2, OPT, BLOOM)을 평가하였다.
  • 뉴스 기사(News Cloud)와 성소수자 개인이 작성한 소셜미디어 게시물(Twitter)로 구성된 두 가지 코퍼스를 대상으로 모델를 미세조정하고, 각각의 편견 감소 효과를 비교하였다.
  • 편견을 정량화하기 위해 WinoQueer 점수(0에서 100 사이)를 사용하였으며, 50은 편견이 없음을 의미하고, 50 초과는 성소수자 개인에게 부정적 스테레오타입을 적용할 경향이 있음을 나타낸다.
Figure 1: Difference in WQ score between baseline and finetuned models, for both QueerNews and QueerTwitter finetuning data. Results are averaged across all 16 models we finetuned and separated by LGBTQ+ identity groups.
Figure 1: Difference in WQ score between baseline and finetuned models, for both QueerNews and QueerTwitter finetuning data. Results are averaged across all 16 models we finetuned and separated by LGBTQ+ identity groups.

실험 결과

연구 질문

  • RQ1사용 가능한 LLM들이 성소수자 커뮤니티가 보고한 반성소수자 스테레오타입을 어느 정도 내재하고 있는가?
  • RQ2성소수자 개인이 작성한 콘텐츠로 미세조정하는 것이 비성소수자 기자들이 작성한 기사로 미세조정하는 것보다 반퀴어 편견을 더 효과적으로 줄일 수 있는가?
  • RQ3뉴스 미디어와 소셜미디어 콘텐츠 등 서로 다른 유형의 훈련 데이터가 LLM 내 반성소수자 편견 완화에 어떤 영향을 미치는가?
  • RQ4현재의 벤치마크는 어떻게 교차 정체성 또는 비서구권 성적 정체성과 성별 정체성을 충분히 반영하지 못하고 있는가?
  • RQ5WinoQueer 점수가 50 이하일 경우의 의미는 무엇이며, 이러한 점수는 모델의 공정성 측면에서 어떻게 해석되어야 하는가?

주요 결과

  • 평가된 모든 LLM에서 뚜렷한 반퀴어 편견이 나타났으며, WinoQueer 점수는 모두 50을 크게 초과하여 성소수자 정체성과 부정적 특성을 연결할 가능성이 높다는 것을 시사한다.
  • 성소수자 개인이 작성한 소셜미디어 글로 미세조정하는 것이 비성소수자 기자들이 작성한 뉴스 기사로 미세조정하는 것보다 편견 감소 효과가 뛰어나게 나타났다.
  • 커뮤니티가 생성한 콘텐츠로 미세조정한 모델들은 WinoQueer 점수에서 측정 가능한 향상을 보였으며, 훈련 데이터 내 표현의 다양성이 해로운 스테레오타입 완화에 기여할 수 있음을 입증하였다.
  • 일부 미세조정된 모델은 WinoQueer 벤치마크에서 50 이하의 점수를 기록하여 이성애자 및 비성전환자 개인에게도 부정적 스테레오타입을 적용할 가능성이 높다는 것을 시사하며, 의도하지 않은 편향 이동에 대한 우려를 제기한다.
  • 벤치마크는 비서구권 이름, 비이원성 대명사, 교차 정체성의 표현이 부족하여 현재의 커버리지에 여전히 격차가 있음을 드러냈다.
  • 기존의 커뮤니티 기반의 모델링 방식은 커뮤니티 고유의 피해를 충분히 반영하지 못하므로, 편견 벤치마크 개발 과정에서 커뮤니티의 참여가 매우 중요하다는 점을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.