[論文レビュー] Evaluating Large Language Models in Theory of Mind Tasks
この研究は40のタスクにわたる640の誤信提示プロンプトに対して11のLLMを評価する。GPT-4は75%のタスクを解き、小学生の能力に近づく一方、より小さなモデルは解けず、初期モデルは約20%にとどまる。
Eleven Large Language Models (LLMs) were assessed using a custom-made battery of false-belief tasks, considered a gold standard in testing Theory of Mind (ToM) in humans. The battery included 640 prompts spread across 40 diverse tasks, each one including a false-belief scenario, three closely matched true-belief control scenarios, and the reversed versions of all four. To solve a single task, a model needed to correctly answer 16 prompts across all eight scenarios. Smaller and older models solved no tasks; GPT-3-davinci-003 (from November 2022) and ChatGPT-3.5-turbo (from March 2023) solved 20% of the tasks; ChatGPT-4 (from June 2023) solved 75% of the tasks, matching the performance of six-year-old children observed in past studies. We explore the potential interpretation of these findings, including the intriguing possibility that ToM, previously considered exclusive to humans, may have spontaneously emerged as a byproduct of LLMs' improving language skills.
研究の動機と目的
- 大規模言語モデルが誤信タスクの電池で心の理論(ToM)能力を示すかどうかを評価する。
- 小規模/古いモデルから最先端モデルまで、11のLLMのパフォーマンスを比較する。
- モデルの言語能力が向上するにつれてToM様の能力の出現を定量化する。
提案手法
- 誤信タスクのカスタム電池を使用する(40タスクにわたる640プロンプト)。
- 各タスクには誤信シナリオ、3つの対応する真信控制、およびすべての4シナリオの反転バージョンが含まれる。
- 1つのタスクを解くには8つのシナリオを通じて16プロンプトに正解する必要がある。
- 評価はサイズとアーキテクチャが異なる11のLLMを横断して行われる。
- 結果は過去のToM研究における人間のベンチマークと相対して議論される。
- 再現のためにコードとタスクを(Colabで)公開する。
実験結果
リサーチクエスチョン
- RQ111のLLMが誤信タスクの電池でどう性能を示すか。
- RQ2ToMのパフォーマンスは新しくより能力の高い言語モデルで改善するか。
- RQ3ToM様の能力は言語モデルの進歩の副産物として自然に出現するか。
- RQ4モデルのパフォーマンスは過去の研究の人間のToMベンチマークとどう比較されるか。
主な発見
- 小型および古いLLMは電池のタスクを解くことができなかった。
- GPT-3-davinci-003(2022年11月)とChatGPT-3.5-turbo(2023年3月)は約20%のタスクを解いた。
- ChatGPT-4(2023年6月)は約75%のタスクを解いた。
- GPT-4のパフォーマンスは過去の六歳児の研究で見られた水準と一致した。
- 結果は、言語スキルの向上に伴いToMがLLMで自発的に出現する可能性を示唆する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。