Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Large Language Models in Theory of Mind Tasks

Michał Kosiński|arXiv (Cornell University)|Feb 4, 2023
Topic Modeling被引用数 132
ひとこと要約

この研究は40のタスクにわたる640の誤信提示プロンプトに対して11のLLMを評価する。GPT-4は75%のタスクを解き、小学生の能力に近づく一方、より小さなモデルは解けず、初期モデルは約20%にとどまる。

ABSTRACT

Eleven Large Language Models (LLMs) were assessed using a custom-made battery of false-belief tasks, considered a gold standard in testing Theory of Mind (ToM) in humans. The battery included 640 prompts spread across 40 diverse tasks, each one including a false-belief scenario, three closely matched true-belief control scenarios, and the reversed versions of all four. To solve a single task, a model needed to correctly answer 16 prompts across all eight scenarios. Smaller and older models solved no tasks; GPT-3-davinci-003 (from November 2022) and ChatGPT-3.5-turbo (from March 2023) solved 20% of the tasks; ChatGPT-4 (from June 2023) solved 75% of the tasks, matching the performance of six-year-old children observed in past studies. We explore the potential interpretation of these findings, including the intriguing possibility that ToM, previously considered exclusive to humans, may have spontaneously emerged as a byproduct of LLMs' improving language skills.

研究の動機と目的

  • 大規模言語モデルが誤信タスクの電池で心の理論(ToM)能力を示すかどうかを評価する。
  • 小規模/古いモデルから最先端モデルまで、11のLLMのパフォーマンスを比較する。
  • モデルの言語能力が向上するにつれてToM様の能力の出現を定量化する。

提案手法

  • 誤信タスクのカスタム電池を使用する(40タスクにわたる640プロンプト)。
  • 各タスクには誤信シナリオ、3つの対応する真信控制、およびすべての4シナリオの反転バージョンが含まれる。
  • 1つのタスクを解くには8つのシナリオを通じて16プロンプトに正解する必要がある。
  • 評価はサイズとアーキテクチャが異なる11のLLMを横断して行われる。
  • 結果は過去のToM研究における人間のベンチマークと相対して議論される。
  • 再現のためにコードとタスクを(Colabで)公開する。

実験結果

リサーチクエスチョン

  • RQ111のLLMが誤信タスクの電池でどう性能を示すか。
  • RQ2ToMのパフォーマンスは新しくより能力の高い言語モデルで改善するか。
  • RQ3ToM様の能力は言語モデルの進歩の副産物として自然に出現するか。
  • RQ4モデルのパフォーマンスは過去の研究の人間のToMベンチマークとどう比較されるか。

主な発見

  • 小型および古いLLMは電池のタスクを解くことができなかった。
  • GPT-3-davinci-003(2022年11月)とChatGPT-3.5-turbo(2023年3月)は約20%のタスクを解いた。
  • ChatGPT-4(2023年6月)は約75%のタスクを解いた。
  • GPT-4のパフォーマンスは過去の六歳児の研究で見られた水準と一致した。
  • 結果は、言語スキルの向上に伴いToMがLLMで自発的に出現する可能性を示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。