Skip to main content
QUICK REVIEW

[논문 리뷰] Generative Language Models Exhibit Social Identity Biases

Tiancheng Hu, Yara Kyrychenko|arXiv (Cornell University)|2023. 10. 24.
Topic Modeling인용 수 4
한 줄 요약

이 연구는 51개의 대규모 언어 모델(Large Language Models, LLMs)이 '우리는...'와 같은 문장 완성 요청을 받을 때 사회적 정체성 편향, 즉 내집단 유대감과 외집단 적대감을 보임을 입증한다. 이 모델들은 인간이 작성한 인터넷 텍스트와 유사하거나 그 이상의 편향 수준을 보이며, 파rtisan(편향된) 트위터 데이터로 미세조정하면 이러한 편향이 악화된다. 반면, 편향된 학습 데이터를 제거하면 편향 수준이 크게 감소함을 확인하여, 학습 데이터의 선별적 구성이 이러한 편향을 완화하는 데 기여할 수 있음을 시사한다.

ABSTRACT

The surge in popularity of large language models has given rise to concerns about biases that these models could learn from humans. We investigate whether ingroup solidarity and outgroup hostility, fundamental social identity biases known from social psychology, are present in 56 large language models. We find that almost all foundational language models and some instruction fine-tuned models exhibit clear ingroup-positive and outgroup-negative associations when prompted to complete sentences (e.g., "We are..."). Our findings suggest that modern language models exhibit fundamental social identity biases to a similar degree as humans, both in the lab and in real-world conversations with LLMs, and that curating training data and instruction fine-tuning can mitigate such biases. Our results have practical implications for creating less biased large-language models and further underscore the need for more research into user interactions with LLMs to prevent potential bias reinforcement in humans.

연구 동기 및 목표

  • 기초 및 지시 희소화된 LLM이 내집단 유대감과 외집단 적대감과 같은 사회적 정체성 편향을 보이는지 조사하기.
  • LLM이 생성한 텍스트와 인터넷에서 작성된 인간의 텍스트 간 이러한 편향 수준을 비교하기.
  • 편향된 학습 데이터로 LLM을 미세조정할 경우 사회적 정체성 편향이 어떻게 영향을 받는지 분석하기.
  • 학습 데이터에서 편향된 문장을 제거하면 LLM 내 사회적 정체성 편향이 어떻게 감소하는지 평가하기.
  • LLM이 학습 데이터에 존재하는 사회적 편향을 학습하고 이를 강화할 수 있음을 입증하며, 이는 AI의 공정성 및 인간-AI 상호작용에 영향을 미친다.

제안 방법

  • 연구는 51개의 LLM에 '우리는...'과 '그들은...'로 시작하는 문장을 완성하도록 요청하는 프롬프트 기반 접근법을 사용하여 내집단 및 외집단 표현을 유도한다.
  • 감성 분석을 위해 VADER와 RoBERTa를 활용하여 생성된 문장을 긍정, 부정, 중립으로 분류하고, 감성 극성 값을 편향의 대체 지표로 사용한다.
  • 내집단 대비 외집단 문장의 긍정 또는 부정 감성 발생 확률을 추정하기 위해 로지스틱 회귀 모델을 사용하며, 문장 길이와 유형-토큰 비율을 제어한다.
  • 혼합효과 로지스틱 회귀 모델을 활용하여 모델 간 내집단 유대감과 외집단 적대감의 총합 수준을 추정하며, 모델 이름을 무작위 절편으로 설정한다.
  • 미세조정을 위해 미국의 편향된 트위터 데이터 코퍼스를 사용하며, 내집단 긍정 문장과 외집단 부정 문장의 비율을 다양하게 조절하여 편향에 미치는 영향을 평가한다.
  • 데이터 정제 과정은 LIWC 2022를 활용해 '우리' 또는 '그들'을 포함하는 문장을 필터링하고, VADER를 사용해 감성을 분류한 후, 감성 임계값 ±0.05 이상 또는 이하의 문장을 제거한다.

실험 결과

연구 질문

  • RQ1대규모 언어 모델(Large Language Models)은 내집단 유대감과 외집단 적대감과 같은 사회적 정체성 편향을 보이는가?
  • RQ2LLM이 생성한 텍스트의 내집단 유대감과 외집단 적대감 수준은 인간이 작성한 인터넷 텍스트와 비교해 어떻게 다른가?
  • RQ3LLM을 편향된 트위터 데이터로 미세조정하면 사회적 정체성 편향이 악화되는가?
  • RQ4학습 데이터에서 편향된 문장을 줄이거나 제거하면 내집단 유대감과 외집단 적대감이 유의미하게 감소하는가?
  • RQ5LLM 내 사회적 정체성 편향은 어느 정도 학습 데이터의 구성에 의해 결정되는가?

주요 결과

  • 검토된 51개의 LLM 중 3개를 제외한 나머지 모두가 '우리는...'과 '그들은...' 프롬프트를 받을 때 측정 가능한 수준의 내집단 유대감과 외집단 적대감을 보였다.
  • LLM이 생성한 텍스트의 내집단 유대감과 외집단 적대감 수준은 위키피디아, 레딧, 뉴스 사이트 등에서 찾을 수 있는 인간이 작성한 인터넷 텍스트와 유사하거나 그 이상이었다.
  • 미세조정을 통해 미국의 편향된 트위터 데이터 코퍼스를 사용하면 내집단 유대감과 외집단 적대감이 뚜렷하게 증가하였으며, 이는 모델들이 학습 데이터에서 편향을 학습하고 내재화할 수 있음을 보여준다.
  • 미세조정 데이터에서 내집단 긍정 문장이나 외집단 부정 문장(또는 둘 다)을 제거하면 내집단 유대감과 외집단 적대감이 유의미하게 감소하였으며, 이는 데이터 정제를 통한 편향 완화가 가능함을 시사한다.
  • 내집단 긍정 콘텐츠가 풍부한 데이터로 미세조정할 경우 내집단 유대감의 오즈 오즈비가 유의미하게 증가하였고, 외집단 부정 콘텐츠가 존재할 경우 외집단 적대감의 오즈 오즈비는 더욱 강하게 증가하였다.
  • 이 연구는 LLM 내 사회적 정체성 편향이 본질적인 것이 아니라 학습 데이터로부터 학습된 것이며, 따라서 선택적 데이터 필터링을 통해 감소시킬 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.