Skip to main content
QUICK REVIEW

[논문 리뷰] Using cognitive psychology to understand GPT-3

Marcel Binz, Eric Schulz|arXiv (Cornell University)|2022. 06. 21.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 인지심리학 실험을 적용하여 GPT-3의 추론 및 의사결정 능력을 평가하며, 비디오 기반 과제와 경험 기반 의사결정에서 뛰어난 성능을 보이지만 원인 분석 추론과 방향성 탐색에 실패함을 발견함. 일부 영역에서 뛰어난 성능을 보이지만, GPT-3는 프롬프트 변형에 매우 민감하며 활동적 탐색과 원인 인과 추론과 같은 인간과 유사한 인지 메커니즘을 갖추지 못함.

ABSTRACT

We study GPT-3, a recent large language model, using tools from cognitive psychology. More specifically, we assess GPT-3's decision-making, information search, deliberation, and causal reasoning abilities on a battery of canonical experiments from the literature. We find that much of GPT-3's behavior is impressive: it solves vignette-based tasks similarly or better than human subjects, is able to make decent decisions from descriptions, outperforms humans in a multi-armed bandit task, and shows signatures of model-based reinforcement learning. Yet we also find that small perturbations to vignette-based tasks can lead GPT-3 vastly astray, that it shows no signatures of directed exploration, and that it fails miserably in a causal reasoning task. These results enrich our understanding of current large language models and pave the way for future investigations using tools from cognitive psychology to study increasingly capable and opaque artificial agents.

연구 동기 및 목표

  • 기존 심리학 실험을 활용하여 GPT-3가 인간과 유사한 인지 행동을 보이는지 평가하기.
  • GPT-3가 의사결정, 정보 탐색, 숙고, 원인 인과 추론 분야의 전통적 과제에서 어떻게 수행되는지 조사하기.
  • 특히 탐색과 원인 인과 추론에서 GPT-3의 행동과 인간 인지 간의 격차를 특정하기.
  • GPT-3의 성능가 프롬프트 변형에 뛰어나게 민감한지 또는 악성 변형에 취약한지 평가하기.
  • 이러한 발견이 더 인간과 유사한 인공 에이전트 개발에 미치는 영향을 탐색하기.

제안 방법

  • 기존 인지심리학 문헌에서 유래한 비디오 기반 과제를 GPT-3에 제공하여 사전 정의된 가정적 시나리오를 사용함.
  • 프로그래밍적으로 생성된 시험을 통해 경험 기반 의사결정 및 강화 학습 능력을 평가하기 위한 과제 기반 실험을 실시함.
  • 다중 손잡이 슬롯머신 과제에서 GPT-3의 행동을 평가하여 탐색 및 이용 전략을 분석함.
  • 원인 인과 추론 과제를 사용하여 GPT-3가 관찰 자료에서 간섭 효과를 추론할 수 있는지 테스트함.
  • 동일한 과제에서 인간의 성과와 GPT-3의 응답을 비교하여 인간과 유사성 여부를 평가함.
  • 프롬프트 변형에 따른 응답 일관성 분석을 통해 정확성과 어조 민감도를 평가함.

실험 결과

연구 질문

  • RQ1GPT-3는 인간과 유사한 수준으로 전통적인 인지심리학 비디오 기반 과제를 해결할 수 있는가?
  • RQ2GPT-3는 경험 기반 과제에서 인간과 유사한 의사결정 및 정보 탐색 행동을 보이는가?
  • RQ3GPT-3는 순차적 의사결정 과제에서 방향성 탐색 또는 모델 기반 강화 학습을 보이는가?
  • RQ4GPT-3는 간섭 기반 추론이 필요한 과제에서 원인 인과 추론을 수행할 수 있는가?
  • RQ5GPT-3의 성능는 프롬프트 어조나 과제 제시 방식의 미세한 변화에 얼마나 민감한가?

주요 결과

  • GPT-3는 대부분의 비디오 기반 과제에서 인간 참가자와 유사하거나 그 이상의 성능로 해결함.
  • GPT-3는 다중 손잡이 슬롯머신 과제에서 인간을 능가하여 경험 기반 의사결정에서 뛰어난 성능을 보임.
  • GPT-3는 모델 기반 강화 학습의 징후를 보이며, 결과에 대한 내부 상태 표현이 있음을 시사함.
  • 비디오 프롬프트에 대한 작은 변형이 GPT-3의 응답을 근본적으로 변화시켜 입력 구성에 매우 민감함을 나타냄.
  • GPT-3는 방향성 탐색의 증거를 보이지 않아 불확실성을 줄이기 위해 정보를 적극적으로 구하지 못함.
  • GPT-3는 원인 인과 추론 과제에서 완전히 실패하여 관찰 데이터에서 간섭 효과를 추론할 수 없음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.