Skip to main content
QUICK REVIEW

[論文レビュー] LLMs achieve adult human performance on higher-order theory of mind tasks

Winnie Street, John Oliver Siy|arXiv (Cornell University)|May 29, 2024
EEG and Brain-Computer Interfaces被引用数 16
ひとこと要約

本論文は MoToMQA を導入し、LLM の ToM を 6 階層まで評価し、GPT-4 と Flan-PaLM が成人レベルまたはほぼ成人レベルの性能を達成し、GPT-4 が 6 階層推論で卓越することを示す。モデルサイズとファインチューニングが高次の ToM 能力を向上させる可能性を示唆し、倫理的・実践的な影響とリスクについて論じる。

ABSTRACT

This paper examines the extent to which large language models (LLMs) have developed higher-order theory of mind (ToM); the human ability to reason about multiple mental and emotional states in a recursive manner (e.g. I think that you believe that she knows). This paper builds on prior work by introducing a handwritten test suite -- Multi-Order Theory of Mind Q&A -- and using it to compare the performance of five LLMs to a newly gathered adult human benchmark. We find that GPT-4 and Flan-PaLM reach adult-level and near adult-level performance on ToM tasks overall, and that GPT-4 exceeds adult performance on 6th order inferences. Our results suggest that there is an interplay between model size and finetuning for the realisation of ToM abilities, and that the best-performing LLMs have developed a generalised capacity for ToM. Given the role that higher-order ToM plays in a wide range of cooperative and competitive human behaviours, these findings have significant implications for user-facing LLM applications.

研究の動機と目的

  • 6次までの大規模言語モデル(LLMs)の高次のToM(Theory of Mind)を評価する。
  • 手書きのテストスイートを用いて成人の基準と比較し、LLM ToM の性能を比較する。
  • 同程度の複雑さを持つ事実の想起タスクと ToM の性能を比較する。
  • モデルサイズ、ファインチューニング、プロンプティングが ToM 能力に及ぼす影響を調査する。
  • LLMs が高次 ToM を有することの潜在的な倫理的・実践的影響を探る。

提案手法

  • 成人向け Imposing Memory Task(IMT)に基づく MoToMQA ベンチマークを導入する。
  • 20 の真偽文から成る 7 つの短い社会的ストーリーを作成する;うち 10 は ToM(順序 2-6)、10 は事実的な文。
  • 比較可能性を確保するため、管理されたストーリー/応答条件下で成人の回答を収集する(n≈29,259)。
  • 真偽確率を導出するために複数の候補トークンを用いた logprob ベースのスコアリングを用い、5つの LLM(GPT-3.5 Turbo Instruct, GPT-4, LaMDA, PaLM, Flan-PaLM)を評価する。
  • 人間と LLM の結果を二値反応にマッピングする; statement ごとに人間の回答を単一の true/false に圧縮して単位を揃える。
  • Cochran の Q、McNemar の検定、独立比の検定で結果を分析し、プロンプト/応答条件間のアンカリング効果を検証する。
Figure 1: Human, LaMDA, PaLM, Flan-PaLM, GPT-3.5 and GPT-4 performance on ToM tasks up to order 6
Figure 1: Human, LaMDA, PaLM, Flan-PaLM, GPT-3.5 and GPT-4 performance on ToM tasks up to order 6

実験結果

リサーチクエスチョン

  • RQ1LLMs は成人人間と比較して、どの程度まで高次 ToM 論理(順序 2-6)を実行できるか。
  • RQ2モデルサイズとファインチューニング(指示調整、RLHF)によって ToM の性能は現代の LLM でどのように変化するか。
  • RQ3同様の複雑さを持つ同等の事実タスクの性能と ToM の性能を比較するとどうなるか。
  • RQ4プロンプトと応答順序(アンカリング効果)が LLM と人間の ToM 応答に影響を与えるか。
  • RQ5最も高い性能を示すモデルにおいて、マルチモーダル性や訓練データなどの要因が ToM 能力をより実現する可能性はあるか。

主な発見

  • GPT-4 と Flan-PaLM は、順序を問わず人間と同等またはそれに近い ToM パフォーマンスを達成しており、GPT-4 は 6 番目の推論で人間を超える。
  • モデル間では GPT-4 と Flan-PaLM が総合的に他を上回り、GPT-4 と人間は順序 2-4 および 6 で同等の性能を示し、順序 6 では GPT-4 が人間を超える。
  • GPT-4 は総合 ToM 正解率で最高となり(89%)、GPT-4 は順序 6 で 93% を達成する一方、人間は同じ順序で 82% にとどまる。
  • 事実の想起タスクは多くのモデルにとって ToM タスクより一般的に易しいが、いくつかのモデル(GPT-4、Flan-PaLM)はこのギャップにもかかわらず高い ToM 性能を維持する。
  • より大きく指示調整されたモデルは、潜在的なマルチモーダルやフィードバックベースの訓練を持つことで、より小さく非ファインチューニングされたモデルより ToM 能力をより良く実現することを示唆している。
  • アンカリング(真偽の先行提示 vs 偽の先行提示)は一部のモデル(PaLM, GPT-3.5)に影響を与えるが、GPT-4、Flan-PaLM、あるいは人間には影響を与えない。
LLMs achieve adult human performance on higher-order theory of mind tasks

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。