Skip to main content
QUICK REVIEW

[논문 리뷰] Queer People are People First: Deconstructing Sexual Identity Stereotypes in Large Language Models

Harnoor Dhingra, Preetiha Jayashanker|arXiv (Cornell University)|2023. 06. 30.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 생성된 텍스트에서 레즈비언, 게이, 비이성애자 개인에 대한 표현적 편향을 측정하고 이를 완화하기 위해 대규모 언어 모델(Large Language Models, LLMs)의 태도 점수를 분석한다. 사고의 사슬 프롬프팅과 SHAP 분석을 활용해 비이성애자 정체성과 관련된 낮은 태도 점수를 가진 단어를 특정하고, 맥락을 유지하면서도 태도 점수를 높이는 사후 텍스트 간 스타일 전이 방법을 적용함으로써, 긍정적인 LLM 출력을 위한 유망한 편향 제거 기법을 입증한다.

ABSTRACT

Large Language Models (LLMs) are trained primarily on minimally processed web text, which exhibits the same wide range of social biases held by the humans who created that content. Consequently, text generated by LLMs can inadvertently perpetuate stereotypes towards marginalized groups, like the LGBTQIA+ community. In this paper, we perform a comparative study of how LLMs generate text describing people with different sexual identities. Analyzing bias in the text generated by an LLM using regard score shows measurable bias against queer people. We then show that a post-hoc method based on chain-of-thought prompting using SHAP analysis can increase the regard of the sentence, representing a promising approach towards debiasing the output of LLMs in this setting.

연구 동기 및 목표

  • 사전 훈련된 LLM이 생성된 텍스트에서 비이성애자 개인에 대해 측정 가능하고 정량화 가능한 편향을 지속적으로 유발하는지 조사하기 위해.
  • 편재하는 집단에 대한 사회적 인식을 반영하는 태도 점수 지표를 사용해 표현적 편향을 정량화하기 위해.
  • 비이성애자 정체성의 주제에 대해 태도 점수를 향상시키면서도 맥락의 무결성을 유지하는 사후 편향 제거 방법을 개발하고 평가하기 위해.
  • LLM 출력에서 낮은 태도 점수를 가지는 언어 패턴이 설명 가능한 인공지능 기법을 통해 체계적으로 식별되고 재작성될 수 있음을 입증하기 위해.

제안 방법

  • 성 중립적인 생애사(비이성애자 정체성과 관련된 성별 효과를 최소화하기 위해 익명화된 프롬프트로 사용된 위키바이오 데이터셋의 생애사.
  • 성적 정체성(예: '이성애자', '게이', 'Lesbian')를 나타내는 트리거 단어를 프롬프트에 앞서 추가하여 정체성에 따라 다른 LLM 출력을 유도하기 위해.
  • Sheng 등(2019)에서 제시한 태도 점수를 사용해 생성된 서술문의 사회적 인식을 정량화하기 위해.
  • 태도 분류기의 SHAP 분석을 적용해 비이성애자 정체성 출력에서 낮은 태도 점수에 기여하는 특정 단어를 식별하기 위해.
  • 의미를 유지하면서도 편향을 유발하는 단어를 교체하는 방식으로 낮은 태도 점수를 가진 문장을 재작성하는 사후 텍스트 간 스타일 전이 방법을 제안하기 위해.
  • 사고의 사슬 프롬프팅을 활용해 LLM이 낮은 태도 점수를 가진 단어를 식별하고 교체하도록 유도함으로써, 핵심 맥락을 변경하지 않은 채 태도 점수를 향상시키기 위해.

실험 결과

연구 질문

  • RQ1RQ1: 사전 훈련된 LLM이 생성 텍스트에서 비이성애자에 대해 측정 가능하고 정량화 가능한 편향을 지속적으로 반영하는가?
  • RQ2RQ2: 사후 편향 제거 방법을 통해 LLM 출력의 편향을 맥락 정보를 유지하면서 완화시킬 수 있는가?
  • RQ3RQ3: SHAP와 사고의 사슬 프롬프팅은 LLM 출력에서 낮은 태도 점수를 가지는 언어 패턴을 어느 정도 체계적으로 식별하고 수정할 수 있는가?

주요 결과

  • LLM은 이성애자로 식별된 사람들보다 비이성애자로 식별된 사람들에 대해 유의미하게 낮은 태도 점수를 생성함으로써 측정 가능한 표현적 편향을 보여주었다.
  • 비이성애자 정체성을 나타내는 트리거 단어 사용은 고통과 기부 정신을 강조하는 출력을 유도한 반면, 이성애자로 식별된 주제는 주로 전문적 성공에 초점이 맞춰져 있었다.
  • SHAP 분석은 모델 출력에서 낮은 태도 점수와 관련된 특정 단어—예를 들어 '게이'—를 성공적으로 식별하였다.
  • 사고의 사슬 프롬프팅을 통해 LLM은 낮은 태도 점수를 가진 단어를 식별하고 교체할 수 있었으며, 이로 인해 핵심 의미적 내용을 변경하지 않은 채 태도 점수는 향상되었다.
  • 사후 편향 제거 방법은 맥락 정보를 유지하면서도 태도 점수를 높였으며, 목표 지향적이고 맥락을 유지하는 완화 전략의 가능성은 입증되었다.
  • 결과적으로, 비이성애자 개인은 성 중립적이고 사실적으로 동일한 맥락의 생애사를 기반으로 하더라도 LLM 출력에서 체계적으로 낮은 사회적 인식을 반영하고 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.