[論文レビュー] LLMs achieve adult human performance on higher-order theory of mind tasks
本論文は MoToMQA を導入し、LLM の ToM を 6 階層まで評価し、GPT-4 と Flan-PaLM が成人レベルまたはほぼ成人レベルの性能を達成し、GPT-4 が 6 階層推論で卓越することを示す。モデルサイズとファインチューニングが高次の ToM 能力を向上させる可能性を示唆し、倫理的・実践的な影響とリスクについて論じる。
This paper examines the extent to which large language models (LLMs) have developed higher-order theory of mind (ToM); the human ability to reason about multiple mental and emotional states in a recursive manner (e.g. I think that you believe that she knows). This paper builds on prior work by introducing a handwritten test suite -- Multi-Order Theory of Mind Q&A -- and using it to compare the performance of five LLMs to a newly gathered adult human benchmark. We find that GPT-4 and Flan-PaLM reach adult-level and near adult-level performance on ToM tasks overall, and that GPT-4 exceeds adult performance on 6th order inferences. Our results suggest that there is an interplay between model size and finetuning for the realisation of ToM abilities, and that the best-performing LLMs have developed a generalised capacity for ToM. Given the role that higher-order ToM plays in a wide range of cooperative and competitive human behaviours, these findings have significant implications for user-facing LLM applications.
研究の動機と目的
- 6次までの大規模言語モデル(LLMs)の高次のToM(Theory of Mind)を評価する。
- 手書きのテストスイートを用いて成人の基準と比較し、LLM ToM の性能を比較する。
- 同程度の複雑さを持つ事実の想起タスクと ToM の性能を比較する。
- モデルサイズ、ファインチューニング、プロンプティングが ToM 能力に及ぼす影響を調査する。
- LLMs が高次 ToM を有することの潜在的な倫理的・実践的影響を探る。
提案手法
- 成人向け Imposing Memory Task(IMT)に基づく MoToMQA ベンチマークを導入する。
- 20 の真偽文から成る 7 つの短い社会的ストーリーを作成する;うち 10 は ToM(順序 2-6)、10 は事実的な文。
- 比較可能性を確保するため、管理されたストーリー/応答条件下で成人の回答を収集する(n≈29,259)。
- 真偽確率を導出するために複数の候補トークンを用いた logprob ベースのスコアリングを用い、5つの LLM(GPT-3.5 Turbo Instruct, GPT-4, LaMDA, PaLM, Flan-PaLM)を評価する。
- 人間と LLM の結果を二値反応にマッピングする; statement ごとに人間の回答を単一の true/false に圧縮して単位を揃える。
- Cochran の Q、McNemar の検定、独立比の検定で結果を分析し、プロンプト/応答条件間のアンカリング効果を検証する。

実験結果
リサーチクエスチョン
- RQ1LLMs は成人人間と比較して、どの程度まで高次 ToM 論理(順序 2-6)を実行できるか。
- RQ2モデルサイズとファインチューニング(指示調整、RLHF)によって ToM の性能は現代の LLM でどのように変化するか。
- RQ3同様の複雑さを持つ同等の事実タスクの性能と ToM の性能を比較するとどうなるか。
- RQ4プロンプトと応答順序(アンカリング効果)が LLM と人間の ToM 応答に影響を与えるか。
- RQ5最も高い性能を示すモデルにおいて、マルチモーダル性や訓練データなどの要因が ToM 能力をより実現する可能性はあるか。
主な発見
- GPT-4 と Flan-PaLM は、順序を問わず人間と同等またはそれに近い ToM パフォーマンスを達成しており、GPT-4 は 6 番目の推論で人間を超える。
- モデル間では GPT-4 と Flan-PaLM が総合的に他を上回り、GPT-4 と人間は順序 2-4 および 6 で同等の性能を示し、順序 6 では GPT-4 が人間を超える。
- GPT-4 は総合 ToM 正解率で最高となり(89%)、GPT-4 は順序 6 で 93% を達成する一方、人間は同じ順序で 82% にとどまる。
- 事実の想起タスクは多くのモデルにとって ToM タスクより一般的に易しいが、いくつかのモデル(GPT-4、Flan-PaLM)はこのギャップにもかかわらず高い ToM 性能を維持する。
- より大きく指示調整されたモデルは、潜在的なマルチモーダルやフィードバックベースの訓練を持つことで、より小さく非ファインチューニングされたモデルより ToM 能力をより良く実現することを示唆している。
- アンカリング(真偽の先行提示 vs 偽の先行提示)は一部のモデル(PaLM, GPT-3.5)に影響を与えるが、GPT-4、Flan-PaLM、あるいは人間には影響を与えない。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。