Skip to main content
QUICK REVIEW

[논문 리뷰] Do LLMs exhibit human-like response biases? A case study in survey design

Lindia Tjuatja, Valerie Chen|arXiv (Cornell University)|2023. 11. 07.
Psychology of Social Influence인용 수 5
한 줄 요약

이 연구는 대규모 언어 모델(Large Language Models, LLMs)이 인간과 유사한 응답 편향을 보이는지, 특히 심리학적 편향이 알려진 인간의 반응 패턴을 유도하는 설문지 질문 쌍을 비교함으로써 조사한다. 9개의 LLM에 걸쳐 편향이 있는 변화와 비편향 변화를 포함한 정제된 데이터셋을 사용하여, 저자들은 LLM이 일반적으로 인간의 응답 패턴을 재현하지 못함을 발견하였으며, 특히 RLHF로 미세조정된 모델들은 실제 편향에 대한 민감도가 감소하고 비편향 변화에 대한 민감도가 증가하는 경향을 보였다.

ABSTRACT

As large language models (LLMs) become more capable, there is growing excitement about the possibility of using LLMs as proxies for humans in real-world tasks where subjective labels are desired, such as in surveys and opinion polling. One widely-cited barrier to the adoption of LLMs as proxies for humans in subjective tasks is their sensitivity to prompt wording - but interestingly, humans also display sensitivities to instruction changes in the form of response biases. We investigate the extent to which LLMs reflect human response biases, if at all. We look to survey design, where human response biases caused by changes in the wordings of "prompts" have been extensively explored in social psychology literature. Drawing from these works, we design a dataset and framework to evaluate whether LLMs exhibit human-like response biases in survey questionnaires. Our comprehensive evaluation of nine models shows that popular open and commercial LLMs generally fail to reflect human-like behavior, particularly in models that have undergone RLHF. Furthermore, even if a model shows a significant change in the same direction as humans, we find that they are sensitive to perturbations that do not elicit significant changes in humans. These results highlight the pitfalls of using LLMs as human proxies, and underscore the need for finer-grained characterizations of model behavior. Our code, dataset, and collected samples are available at https://github.com/lindiatjuatja/BiasMonkey

연구 동기 및 목표

  • 사회심리학에서 관찰된 인간과 유사한 응답 편향이 설문지 문항에서 어떻게 나타나는지 LLM이 이를 반영하는지 평가하는 것.
  • 특히 RLHF를 포함한 모델 아키텍처와 훈련 방식이 LLM의 질문 어조 변화에 대한 민감도에 미치는 영향을 평가하는 것.
  • 기존 인간 행동 경향과 비교하여 LLM의 반응을 편향을 유도하는 변화와 비편향 변화에 대해 평가하는 것.
  • LLM이 설문조사나 여론 조사에서 인간 참가자의 대체자로 신뢰성 있게 기능할 수 있다는 가정을 도전하는 것.

제안 방법

  • 연구는 편향을 유도하는 질문과 비편향 변화(예: 철자 오류, 어조 재구성)를 포함한 쌍문제 설문지 데이터셋을 구축한다.
  • Open-source Llama2 변형과 GPT-3.5, GPT-4와 같은 상용 모델을 포함한 9개의 LLM이 질문 쌍을 기반으로 응답 분포를 수집하도록 유도된다.
  • 응답 변화는 통계적 검정(예: McNemar’s test)을 사용하여 질문 유형 간 응답 분포의 유의미한 변화를 측정한다.
  • 기존 사회과학 문헌에서 확립된 인간의 반응 경향과 비교하여 모델의 행동이 얼마나 일치하는지 평가한다.
  • 훈련 방식(예: 지시 미세조정 대비 RLHF 미세조정)에 따라 평가하여 훈련이 편향 민감도에 미치는 영향을 분리한다.
  • LLM이 알려진 인간의 응답 편향을 재현하는지, 아니면 비인간적인 방식으로 비편향 변화에 반응하는지 체계적으로 평가할 수 있는 프레임워크를 개발한다.

실험 결과

연구 질문

  • RQ1LLM은 약간의 어조 변화가 있는 설문지 질문에 노출되었을 때 인간과 동일한 응답 편향 패턴을 보이는가?
  • RQ2RLHF 미세조정은 라이브러리 모델이나 지시 미세조정 모델 대비 LLM의 편향을 유도하는 질문 수정에 대한 민감도에 어떤 영향을 미치는가?
  • RQ3LLM은 인간과 마찬가지로 비편향 변화(예: 철자 오류, 미세한 어조 변경)에 대해 민감한가, 아니면 이러한 변화에 과민하게 반응하는가?
  • RQ4모델 크기나 아키텍처가 인간과 유사한 응답 편향을 재현할 가능성을 높이는 데 영향을 미치는가?
  • RQ5모델이 인간의 의견 분포를 모방할 수 있는 능력이 실제 인간의 응답 편향을 반영할 수 있는 능력과 상관관계가 있는가?

주요 결과

  • 평가된 모든 LLM은 일관되게 인간과 유사한 응답 편향을 반영하지 못했으며, 많은 경우 기존 인간 경향과 반대 방향으로 응답 변화가 발생했다.
  • RLHF로 미세조정된 모델들은 실제 응답 편향에 대한 민감도가 감소했지만, 철자 오류나 미세한 어조 변경과 같은 비편향 변화에 더 민감하게 반응했다.
  • 초기 응답에서 높은 불확실성을 보인 LLM은 편향을 유도하는 수정에 의해 유의미한 변화를 보이지 않았지만, 인간은 그렇지 않았다.
  • 모델이 인간의 의견 분포를 재현할 능력과 실제 인간의 응답 편향을 반영할 능력 사이에 거의 상관관계가 없었다.
  • LLM이 인간과 같은 방향으로 응답 변화를 보였더라도, 그 크기나 일관성은 인간의 행동 패턴과 자주 일치하지 않았다.
  • 결과적으로 RLHF는 의미 있는 언어적 신호에 대한 자연스러운 민감도를 억제하고 잡음은 증폭시켜 인간 대체자로서의 유용성을 떨어뜨릴 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.