Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Large Language Models in Theory of Mind Tasks

Michał Kosiński|arXiv (Cornell University)|2023. 02. 04.
Topic Modeling인용 수 132
한 줄 요약

본 연구는 640개의 잘못된 신념 프롬프트를 40개의 과제에 걸쳐 11개의 LLM을 평가합니다; GPT-4는 과제의 75%를 해결하며 여섯 살 아이의 수행에 근접하고, 더 작은 모델은 전체를 해결하지 못하며, 초기 모델은 약 20%에 도달합니다.

ABSTRACT

Eleven Large Language Models (LLMs) were assessed using a custom-made battery of false-belief tasks, considered a gold standard in testing Theory of Mind (ToM) in humans. The battery included 640 prompts spread across 40 diverse tasks, each one including a false-belief scenario, three closely matched true-belief control scenarios, and the reversed versions of all four. To solve a single task, a model needed to correctly answer 16 prompts across all eight scenarios. Smaller and older models solved no tasks; GPT-3-davinci-003 (from November 2022) and ChatGPT-3.5-turbo (from March 2023) solved 20% of the tasks; ChatGPT-4 (from June 2023) solved 75% of the tasks, matching the performance of six-year-old children observed in past studies. We explore the potential interpretation of these findings, including the intriguing possibility that ToM, previously considered exclusive to humans, may have spontaneously emerged as a byproduct of LLMs' improving language skills.

연구 동기 및 목표

  • 대형 언어 모델이 거짓 신념 과제 배열에서 이론적 마음(ToM) 능력을 보이는지 평가한다.
  • 작고 오래된 모델에서 최첨단 모델에 이르는 11개의 LLM 간 성능을 비교한다.
  • 모델이 언어 능력을 향상시키면서 ToM과 같은 능력이 어떻게 나타나는지 정량화한다.

제안 방법

  • 사용자 정의 거짓 신념 과제 배터리(40개 과제에 걸친 640개의 프롬프트)를 사용한다.
  • 각 과제는 거짓 신념 시나리오, 세 개의 매칭된 실제 신념 대조, 그리고 네 시나리오의 역전 버전을 포함한다.
  • 모델은 하나의 과제를 해결하기 위해 여덟 개의 시나리오에서 16개 프롬프트를 정확히 답해야 한다.
  • 평가는 크기와 구조가 다른 열한 LLM에 걸쳐 수행된다.
  • 결과는 이전 ToM 연구의 인간 벤치마크와의 성능 비교를 다룬다.
  • 코드와 과제는 복제를 위해 공개된다(Colab).

실험 결과

연구 질문

  • RQ1열한 개의 LLM이 이론적 마음(ToM) 거짓 신념 과제 배터리에서 어떻게 수행하는가?
  • RQ2더 새롭고 더 강력한 언어 모델에서 ToM 성능이 개선되는가?
  • RQ3언어 모델링의 발전의 부산물로 ToM과 같은 능력이 자연스럽게 나타나는가?
  • RQ4이전 연구의 인간 ToM 벤치마크와 모델의 성능은 어떻게 비교되는가?

주요 결과

  • 더 작고 더 오래된 LLM은 배터리의 어떤 과제도 해결하지 못했다.
  • GPT-3-davinci-003 (Nov 2022) 및 ChatGPT-3.5-turbo (Mar 2023)는 약 20%의 과제를 해결했다.
  • ChatGPT-4 (Jun 2023)는 약 75%의 과제를 해결했다.
  • GPT-4의 성능은 과거의 여섯 살 아이를 대상으로 한 연구에서 관찰된 수준과 일치했다.
  • 결과는 언어 능력이 LLM에서 향상될 때 ToM이 자발적으로 나타날 가능성을 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.