Skip to main content
QUICK REVIEW

[논문 리뷰] Mind meets machine: Unravelling GPT-4's cognitive psychology

Sifatkaur, Manmeet Mahinderjit Singh|arXiv (Cornell University)|2023. 03. 20.
Topic Modeling인용 수 5
한 줄 요약

이 연구는 GPT-4의 인지심리학 능력을 네 가지 기준 데이터셋—CommonsenseQA, MATH, SuperGLUE, HANS—을 사용하여 평가하며, GPT-4가 상태의 기준을 충족함을 입증한다. CommonsenseQA에서 83.2%의 정확도, SuperGLUE에서 91.2%, prealgebra에서 84%, HANS에서 100%의 정확도를 기록하여 인간의 인지와 유사한 고도의 추론 및 맥락 통합 능력을 보여준다.

ABSTRACT

Cognitive psychology delves on understanding perception, attention, memory, language, problem-solving, decision-making, and reasoning. Large language models (LLMs) are emerging as potent tools increasingly capable of performing human-level tasks. The recent development in the form of GPT-4 and its demonstrated success in tasks complex to humans exam and complex problems has led to an increased confidence in the LLMs to become perfect instruments of intelligence. Although GPT-4 report has shown performance on some cognitive psychology tasks, a comprehensive assessment of GPT-4, via the existing well-established datasets is required. In this study, we focus on the evaluation of GPT-4's performance on a set of cognitive psychology datasets such as CommonsenseQA, SuperGLUE, MATH and HANS. In doing so, we understand how GPT-4 processes and integrates cognitive psychology with contextual information, providing insight into the underlying cognitive processes that enable its ability to generate the responses. We show that GPT-4 exhibits a high level of accuracy in cognitive psychology tasks relative to the prior state-of-the-art models. Our results strengthen the already available assessments and confidence on GPT-4's cognitive psychology abilities. It has significant potential to revolutionize the field of AI, by enabling machines to bridge the gap between human and machine reasoning.

연구 동기 및 목표

  • 기본 벤치마크를 넘어서 표준화된 데이터셋을 활용하여 GPT-4의 인지심리학 능력을 종합적으로 평가하는 것.
  • GPT-4가 공감 추론, 수학 문제 해결, 자연어 추론과 같은 복잡한 인지 과제에서 맥락 정보와 추론을 어떻게 통합하는지 평가하는 것.
  • 심 깊은 추론과 히ュ리스틱 회피가 요구되는 분야에서 이전 최고 성능 모델을 뛰어넘는지 여부를 판단하는 것.
  • HANS와 같은 데이터셋에서 GPT-4가 표면적인 히ュ리스틱에 의존하는지 아니면 강력한 인간 유사 추론을 보이는지 조사하는 것.
  • 인간 기준과의 검증을 통해 GPT-4가 심리학 연구 및 임상 적용에 실용적인 도구로 활용될 수 있음을 확립하는 것.

제안 방법

  • GPT-4를 ChatGPT-Plus API를 통해 접근하여 CommonsenseQA, MATH, SuperGLUE, HANS의 네 가지 인지심리학 데이터셋에서의 성능을 평가하였다.
  • MATH와 CommonsenseQA에는 정확한 일치 및 표준 평가 지표를, SuperGLUE와 HANS에는 표준 NLI 평가 프로토콜을 적용하였다.
  • 추론과 응답 생성을 유도하기 위한 프롬프트를 적용하여 원본 데이터셋 형식과 평가 기준과의 일관성을 확보하였다.
  • 기본 모델(BERT, GPT-2/GPT-3 등) 및 원본 연구에서 보고된 인간 성능과의 비교를 수행하였다.
  • 혼합된 HANS 데이터를 활용한 지속적인 실험을 통해 100% 정확도가 비엔타일먼트 패턴의 기억에 기인한 것인지 평가하였다.
  • 특히 HANS에서 히ュ리스틱 기반 추론의 증거를 분석하여 성능이 강력한 추론에 기반하는지 아니면 표면적인 패턴 매칭에 기반하는지 평가하였다.
Figure 1: Datasets used in the study with the different categories contained in them.
Figure 1: Datasets used in the study with the different categories contained in them.

실험 결과

연구 질문

  • RQ1GPT-4는 공감 추론 및 수학 문제 해결과 같은 인지 추론 과제에서 이전 언어 모델보다 어느 정도 뛰어나게 성능을 내는가?
  • RQ2GPT-4는 SuperGLUE와 HANS에서 강력한 추론 능력을 보이는가, 아니면 일반화를 해칠 수 있는 어휘적 또는 문법적 히ュ리스틱에 의존하는가?
  • RQ3GPT-4의 MATH 및 CommonsenseQA 성능은 정확도와 추론 깊이 측면에서 인간 기준 및 이전 모델과 비교해 볼 때 어떻게 평가되는가?
  • RQ4GPT-4가 인간 유사 인지 과정을 모방할 수 있는 능력을 갖추고 있다는 점을 고려할 때, 심리학 연구의 신뢰할 수 있는 도구로 간주될 수 있는가?
  • RQ5GPT-4가 HANS에서의 성능은 자연어 추론에서 얕은 히ュ리스틱에 취약한지 아니면 이를 피하는지를 보여주는 통찰을 제공하는가?

주요 결과

  • GPT-4는 CommonsenseQA에서 83.2%의 정확도를 기록하여 기준 언어 모델(55.9%)을 크게 앞서며 인간 수준의 성능(89%)에 가까워졌다.
  • SuperGLUE 벤치마크에서 GPT-4는 91.2%의 정확도를 기록하여 복잡한 자연어 이해 및 추론 과제에서 뛰어난 성능을 보였다.
  • MATH 데이터셋에서 GPT-4는 초등대수 문제에서 84%의 정확도를 기록하여 GPT-2 및 GPT-3가 유사 과제에서 기록한 10% 미만의 성능을 크게 뛰어넘었다.
  • GPT-4는 HANS 데이터셋에서 완벽한 100% 정확도를 기록했지만, 이는 테스트 세트에서 비엔타일먼트 패턴을 기억한 것일 수 있다.
  • MATH 내 기하 문제에서는 GPT-4가 35%의 점수를 기록하여 다른 영역에서의 뛰어난 성능에도 불구하고 공간적 및 기하 추론에서 여전히 도전 과제를 안고 있음을 시사한다.
  • 이 연구는 GPT-4가 이전 최고 성능 모델을 뛰어넘는 인지심리학 벤치마크 성능을 보이며 맥락 통합 및 추론 메커니즘의 고도의 통합을 보여주는 것으로 확인되었다.
Figure 2: Examples of sample prompts and the respective responses of GPT4 on CommonsenseQA, MATH and SuperGLUE datasets
Figure 2: Examples of sample prompts and the respective responses of GPT4 on CommonsenseQA, MATH and SuperGLUE datasets

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.