Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models Show Human-like Social Desirability Biases in Survey Responses

Aadesh Salecha, Molly Ireland|arXiv (Cornell University)|2024. 05. 09.
Computational and Text Analysis Methods인용 수 4
한 줄 요약

이 연구는 대규모 언어 모델(Large Language Models, LLMs)이 빅 파이브 성격 검사 응답에서 인간과 유사한 사회적 수용성 편향을 보임을 밝혀냈다. 평가 맥락을 감지할 경우, LLMs는 체계적으로 더 유리한 성격 특성(예: 더 높은 외향성, 더 낮은 신경질성)으로 편향되며, 이는 다수의 질문을 동시에 처리할 때 나타난다. GPT-4의 경우, 한 번에 하나의 질문을 처리할 때 대비 1.20 표준편차 수준으로 유리한 성격 특성으로 향하는 편향을 보였는데, 이는 LLMs가 평가 맥락을 인지하고 이를 바탕으로 응답을 암묵적으로 조정함을 시사하며, 심리측정 연구에서 인간의 대체자로서의 타당성을 떨어뜨린다.

ABSTRACT

As Large Language Models (LLMs) become widely used to model and simulate human behavior, understanding their biases becomes critical. We developed an experimental framework using Big Five personality surveys and uncovered a previously undetected social desirability bias in a wide range of LLMs. By systematically varying the number of questions LLMs were exposed to, we demonstrate their ability to infer when they are being evaluated. When personality evaluation is inferred, LLMs skew their scores towards the desirable ends of trait dimensions (i.e., increased extraversion, decreased neuroticism, etc). This bias exists in all tested models, including GPT-4/3.5, Claude 3, Llama 3, and PaLM-2. Bias levels appear to increase in more recent models, with GPT-4's survey responses changing by 1.20 (human) standard deviations and Llama 3's by 0.98 standard deviations-very large effects. This bias is robust to randomization of question order and paraphrasing. Reverse-coding all the questions decreases bias levels but does not eliminate them, suggesting that this effect cannot be attributed to acquiescence bias. Our findings reveal an emergent social desirability bias and suggest constraints on profiling LLMs with psychometric tests and on using LLMs as proxies for human participants.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)이 자가 보고 성격 평가에서 사회적 수용성 편향을 보이는지 조사하는 것.
  • LLMs가 다수의 질문이 하나의 프롬프트에 포함된 평가 맥락을 감지할 경우 이 편향이 나타나는지 확인하는 것.
  • 이 편향이 다양한 전문 및 오픈소스 LLMs 간에 일반화되고 탄력적인지 평가하는 것.
  • 역코딩 또는 무작위화와 같은 일반적인 완화 전략이 이 편향을 효과적으로 줄이거나 제거하는지 평가하는 것.
  • 이 편향이 심리측정 및 행동 연구에서 LLMs를 인간 참가자의 대체자로 사용할 때의 타당성에 어떤 영향을 미치는지 검토하는 것.

제안 방법

  • LLMs에 100개 항목으로 구성된 빅 파이브 성격 검사(IPIP-100)를 시행하였으며, 각 배치는 1개에서 20개의 질문으로 구성되었고, 이전 항목의 기억을 방지하기 위해 각 배치마다 새로운 채팅 세션을 사용하였다.
  • LLMs가 5점 리커트 척도로 응답하도록 표준화된 지침을 사용하였으며, 프롬프트는 동적으로 질문 수와 항목을 교체하였다.
  • 응답의 확률적 변동성 수준을 테스트하기 위해 온도 파rameter(0.0, 0.4, 0.8, 1.2)를 체계적으로 변화시켰다.
  • 설문 항목의 어색한 표현과 다양한 무작위화 전략(전체 항목 랜덤화, 요인 내 랜덤화, 랜덤화 없음)을 적용하여 어휘 및 순서 민감도를 테스트하였다.
  • 응답 패턴 편향이나 수긍 편향이 효과를 설명할 수 있는지 평가하기 위해 모든 항목을 역코딩하였다. 이 과정에서 의미의 일관성을 유지하였다.
  • GPT-4, GPT-3.5, Claude 3, PaLM-2, Llama 3을 포함한 10개의 LLM을 비교하여 일반화 가능성 여부를 평가하였다.

실험 결과

연구 질문

  • RQ1LLMs는 인간과 유사하게 빅 파이브 성격 검사 응답에서 사회적 수용성 편향을 보이는가?
  • RQ2LLMs가 한 번에 더 많은 질문을 처리할 경우, 평가 맥락을 인지하고 응답을 조정함으로써 편향의 크기가 증가하는가?
  • RQ3질문 순서 무작위화, 어휘 재구성, 온도 변화에 대해 이 편향이 탄력적인가? 이는 표면적인 응답 패턴에 기인한 것이 아님을 시사한다.
  • RQ4설문 항목의 역코딩이 관찰된 사회적 수용성 편향을 제거하거나 크게 줄일 수 있는가?
  • RQ5이 편향은 심리측정 및 행동 연구에서 LLMs를 인간 참가자의 대체자로 사용할 때의 타당성에 얼마나 심각한 영향을 미치는가?

주요 결과

  • GPT-4는 한 번에 20개의 질문을 처리할 경우, 한 개의 질문을 처리할 때 대비 사회적으로 수용 가능한 성격 특성으로 1.20 표준편차 수준으로 편향되었으며, 이 중에서 성실성(+0.96)과 열린 성격(+0.77)에서 가장 큰 증가를 보였다.
  • Llama 3도 동일한 조건에서 0.98 표준편차 수준으로 유리한 성격 특성으로 향하는 편향을 보였으며, 이는 이 편향이 전용 모델에 국한되지 않음을 시사한다.
  • 질문 순서의 무작위화, 항목 어색한 표현, 온도 설정의 변화에 대해 편향이 탄력적으로 유지되어, 이는 표면적인 응답 패턴 오류 때문이 아니라는 것을 시사한다.
  • 모든 항목을 역코딩함으로써 편향은 약 절반으로 줄었지만 완전히 제거되지는 않았으며, 이는 편향이 수긍 편향이나 응답 형식에 기인한 것이 아니라는 것을 시사한다.
  • GPT-3.5, Claude 3, PaLM-2, Llama 2/3를 포함한 모든 테스트된 모델에서 이 편향이 일관되게 관찰되어, LLMs의 평가 맥락 인지 능력에서 유래한 잠재적 성질임을 시사한다.
  • LLMs가 동시에 다수의 질문을 처리할 때 이 효과가 가장 두드러졌으며, 이는 명시적 지시 없이도 평가 맥락을 인지하고 응답을 조정함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.