Skip to main content
QUICK REVIEW

[논문 리뷰] LLMs achieve adult human performance on higher-order theory of mind tasks

Winnie Street, John Oliver Siy|arXiv (Cornell University)|2024. 05. 29.
EEG and Brain-Computer Interfaces인용 수 16
한 줄 요약

이 논문은 MoToMQA를 도입하여 LLM의 6차까지의 ToM를 평가하고 GPT-4와 Flan-PaLM이 성인 수준의 또는 근접한 성과를 달성했으며, GPT-4가 6차 추론에서 두드러지게 우수하다는 점을 보여준다. 또한 모델 크기와 미세조정이 고차 ToM 능력을 높인다고 시사하고, 함의와 위험을 논의한다.

ABSTRACT

This paper examines the extent to which large language models (LLMs) have developed higher-order theory of mind (ToM); the human ability to reason about multiple mental and emotional states in a recursive manner (e.g. I think that you believe that she knows). This paper builds on prior work by introducing a handwritten test suite -- Multi-Order Theory of Mind Q&A -- and using it to compare the performance of five LLMs to a newly gathered adult human benchmark. We find that GPT-4 and Flan-PaLM reach adult-level and near adult-level performance on ToM tasks overall, and that GPT-4 exceeds adult performance on 6th order inferences. Our results suggest that there is an interplay between model size and finetuning for the realisation of ToM abilities, and that the best-performing LLMs have developed a generalised capacity for ToM. Given the role that higher-order ToM plays in a wide range of cooperative and competitive human behaviours, these findings have significant implications for user-facing LLM applications.

연구 동기 및 목표

  • 고차 ToM를 대형 언어 모델(LLM)에서 6차까지 평가한다.
  • 성인 인간 벤치마크와 손글씨로 작성된 테스트 세트를 사용해 LLM ToM 성능을 비교한다.
  • 동일한 복잡성의 사실 기억 작업과 ToM 간의 차이를 검토한다.
  • 모델 크기, 미세조정, 프롬프팅이 ToM 능력에 미치는 영향을 investigates 한다.
  • LLMs가 더 높은 차원의 ToM를 보유하는 데 따른 윤리적 및 실용적 함의를 탐구한다.

제안 방법

  • 성인용 IMT(Imposing Memory Task)를 기반으로 MoToMQA 벤치마크를 도입한다.
  • 20개의 참/거짓 진술을 가진 7개의 짧은 사회적 이야기; 10개의 ToM(차수 2-6) 및 10개의 사실 진술.
  • 비교 가능성을 위해 통제된 이야기/응답 조건에서 성인 응답자(n≈29,259)를 수집한다.
  • logprob 기반 채점으로 다수 후보 토큰을 사용해 진실/거짓 확률을 도출하여 5개의 LLM(GPT-3.5 Turbo Instruct, GPT-4, LaMDA, PaLM, Flan-PaLM)을 평가한다.
  • 인간과 LLM의 결과를 이진 응답으로 매핑하고, 진실/거짓 단일 응답으로 축소하여 단위를 정렬한다.
  • Cochran의 Q, McNemar 검사, 독립 비율 분석으로 결과를 분석하고 프롬프트/응답 조건 간의 정박(anchor) 효과를 검토한다.
Figure 1: Human, LaMDA, PaLM, Flan-PaLM, GPT-3.5 and GPT-4 performance on ToM tasks up to order 6
Figure 1: Human, LaMDA, PaLM, Flan-PaLM, GPT-3.5 and GPT-4 performance on ToM tasks up to order 6

실험 결과

연구 질문

  • RQ1LLM이 성인 인간에 비해 차수 2-6의 고차 ToM 추론을 어느 정도 수행할 수 있는가?
  • RQ2현대 LLM 간의 모델 크기 및 미세조정(지시 미세조정, RLHF)이 ToM 성능에 어떠한 차이를 보이는가?
  • RQ3ToM 성능은 동일한 복잡성의 대응 사실 작업과 비교해 어떤 차이가 있는가?
  • RQ4프롬프팅 및 응답 순서(정박) 효과가 LLM 및 인간의 ToM 응답에 영향을 미치는가?
  • RQ5최고 성능 모델에서 멀티모달성이나 피드백 기반 학습과 같은 요인이 ToM 능력을 더 잘 구현하는 요인인가?

주요 결과

  • GPT-4와 Flan-PaLM은 차수에 대해 성인 수준 또는 그에 근접한 ToM 성능을 보이며, GPT-4는 6차 추론에서 인간을 능가한다.
  • 모델 간에는 GPT-4와 Flan-PaLM이 전반적으로 타 모델보다 우수하며; GPT-4와 인간은 차수 2-4 및 6에서 비슷한 성능을 보이고, 차수 6에서 GPT-4가 인간을 능가한다.
  • GPT-4의 총 ToM 정확도는 89%로 가장 높고, GPT-4는 차수 6에서 93%를 달성하는 반면 인간은 같은 차수에서 82%를 달성한다.
  • 사실 기억 과제는 대부분의 모델에 대해 ToM 과제보다 일반적으로 더 쉽다; 일부 모델(GPT-4, Flan-PaLM)은 이 차이에도 불구하고 강력한 ToM 성능을 유지한다.
  • 더 크고 지시 미세조정된 모델이 멀티모달링이나 피드백 기반 학습의 가능성을 가진 경우, 더 큰 모델이 ToM 능력을 더 잘 구현한다는 증거가 있다.
  • 앵커링(참-우선 vs 거짓-우선 프롬프트)이 일부 모델(PaLM, GPT-3.5)에는 영향을 주지만, GPT-4, Flan-PaLM 또는 인간에는 영향을 주지 않는다.
LLMs achieve adult human performance on higher-order theory of mind tasks

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.