[논문 리뷰] QueerBench: Quantifying Discrimination in Language Models Toward Queer Identities
이 논문은 영어 대규모 언어 모델(Large Language Models, LLMs)에서 반 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ (LGBTQIA+) 편견을 템플릿 기반 접근법과 마스킹된 언어 모델링(Masked Language Modeling, MLM)을 사용하여 정량화하는 새로운 프레임워크인 QueerBench를 소개한다. 이 프레임워크는 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 정체성을 주제로 할 경우 LLM이 유해한 완성을 생성하는 비율이 16.9%에 달함을 드러내며, 이는 비레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제보다 7.2% 높은 수준으로, NLP 시스템 내에서 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 정체성에 대한 체계적인 차별을 보여준다.
With the increasing role of Natural Language Processing (NLP) in various applications, challenges concerning bias and stereotype perpetuation are accentuated, which often leads to hate speech and harm. Despite existing studies on sexism and misogyny, issues like homophobia and transphobia remain underexplored and often adopt binary perspectives, putting the safety of LGBTQIA+ individuals at high risk in online spaces. In this paper, we assess the potential harm caused by sentence completions generated by English large language models (LLMs) concerning LGBTQIA+ individuals. This is achieved using QueerBench, our new assessment framework, which employs a template-based approach and a Masked Language Modeling (MLM) task. The analysis indicates that large language models tend to exhibit discriminatory behaviour more frequently towards individuals within the LGBTQIA+ community, reaching a difference gap of 7.2% in the QueerBench score of harmfulness.
연구 동기 및 목표
- NLP 분야에서 특히 대규모 언어 모델(Large Language Models, LLMs)에서의 동성애 혐오 및 본성 혐오 문제에 대해 다루지 않은 바를 보완하기 위해.
- 특히 이元성 성별 기준을 초월하는 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 정체성에 대해 해로운 언어 생성을 체계적으로 정량화하는 방법을 개발하기 위해.
- 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제와 비레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제에 대해 완성을 생성할 때 LLM의 편향적 성향을 폭 드러내고 측정하기 위해.
- AI 생성 텍스트에서 성다양성 및 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 개인을 배제하는 편향을 특정함으로써 포괄적인 NLP를 촉진하기 위해.
- 향후 NLP 분야에서 반 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 편견에 관한 연구를 지원하기 위해 오픈소스 코드와 데이터를 공개하기 위해.
제안 방법
- 표준화되고 중립적인 맥락을 사용하여 LLM으로부터 문장 완성을 유도하기 위한 템플릿 기반 프롬프팅 프레임워크를 설계한다.
- 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 및 비레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제에 대해 해로운 토큰 예측 가능성을 평가하기 위해 마스킹된 언어 모델링(Masked Language Modeling, MLM) 작업을 활용한다.
- 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 정체성과 관련된 명사와 비레즈비언·Lesbian·Gay·Bisexual·Queer·Inter소르·Transgender·Queer·Questioning·Asexual·+ 정체성과 관련된 명사를 주제로 사용하여 모델 행동을 평가하기 위해 이원성, 신형성, 중립성의 수사어를 포함한 정제된 수사어 세트를 활용한다.
- 다중 모델 생성(상위 1개 및 상위 5개 예측) 동안 해로운 완성 비율을 기반으로 QueerBench 점수를 계산한다.
- 다양한 수사어 및 명사 카테고리 간 해로운 성향의 불균형을 탐지하기 위해 해로운 점수를 비교한다.
- 기본형 및 대용량 버전을 모두 갖춘 여러 LLMs(BERTweet, RoBERTa, ALBERT 등)을 대상으로 모델 크기의 영향을 분석하기 위해 모델 행동을 분석한다.
실험 결과
연구 질문
- RQ1레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 정체성을 가진 명사와 비레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 정체성을 가진 명사에 대해 영어 LLM이 유해한 완성을 생성하는 방식에 어떤 차이가 있는가?
- RQ2이원성 수사어, 신형성 수사어, 중립 수사어를 주제로 삼을 경우 LLM의 해로운 성향 수준은 어떠한가?
- RQ3모델 크기(기본형 대비 대용량)가 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 정체성에 대한 완성의 해로움에 유의미하게 영향을 미치는가?
- RQ4마스킹된 언어 모델링 작업에서 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 정체성에 대해 LLM이 비레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 정체성에 비해 얼마나 차별적인 행동을 보이는가?
- RQ5QueerBench 프레임워크는 재현 가능하고 확장 가능한 방식으로 반 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 편견을 어떻게 탐지하고 정량화하는가?
주요 결과
- 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제에서 LLM은 비레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제보다 유해성이 유의미하게 높게 나타나며, 평균 QueerBench 점수는 16.9%로, 비레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제의 9.2%보다 높다.
- 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제와 비레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제 간 해로운 성향의 격차는 QueerBench 점수에서 최대 7.2%에 달하며, 이는 측정 가능한 차별을 시사한다.
- 수사어 기반 주제에서 해로운 성향은 이원성 수사어(6.1%)에서 가장 높고, 신형성 수사어(5.4%) 다음, 중립 수사어(4.9%)에서 가장 낮다.
- 상위 5개 예측에서는 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제의 경우 상위 1개 예측 대비 해로운 성향이 13% 증가하여, 모델의 다양성이 편향을 악화시킬 수 있음을 시사한다.
- BERTweet 기본형 모델은 레즈비언·Lesbian·Gay·Bisexual·Queer·Intersex·Transgender·Queer·Questioning·Asexual·+ 주제에서 상위 5개 예측에서 해로운 성향이 특히 높게 나타나(27%) 데이터나 아키텍처 기반의 편향이 있음을 시사한다.
- 대용량 모델은 기본형 모델보다 전체적으로 약간 낮은 해로운 성향을 보이며(예: 레즈비언 명사 기준 8.2% 대비 11.4%), 그러나 이 차이는 통계적으로 유의미하지 않아 크기만으로는 편향이 감소하지 않음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.