Skip to main content
QUICK REVIEW

[論文レビュー] Neural Theory-of-Mind? On the Limits of Social Intelligence in Large LMs

Maarten Sap, Ronan LeBras|arXiv (Cornell University)|Oct 24, 2022
Topic Modeling被引用数 11
ひとこと要約

この論文は、GPT-3 などの大規模言語モデル(LLM)が社会的意図、感情、誤った信念について推論できるかどうか、すなわち神経的マインド理論(ToM)を示すかを調査する。SocialIQa および ToMi のベンチマークを用いて評価した結果、GPT-3 でさえもそれぞれ 55% および 60% の正確性にとどまり、人間の性能より著しく低いことが判明した。これは、データ、アーキテクチャ、学習パラダイムの制限により、規模の拡大にもかかわらず社会的知能に根本的な限界があることを示している。

ABSTRACT

Social intelligence and Theory of Mind (ToM), i.e., the ability to reason about the different mental states, intents, and reactions of all people involved, allow humans to effectively navigate and understand everyday social interactions. As NLP systems are used in increasingly complex social situations, their ability to grasp social dynamics becomes crucial. In this work, we examine the open question of social intelligence and Theory of Mind in modern NLP systems from an empirical and theory-based perspective. We show that one of today's largest language models (GPT-3; Brown et al., 2020) lacks this kind of social intelligence out-of-the box, using two tasks: SocialIQa (Sap et al., 2019), which measures models' ability to understand intents and reactions of participants of social interactions, and ToMi (Le et al., 2019), which measures whether models can infer mental states and realities of participants of situations. Our results show that models struggle substantially at these Theory of Mind tasks, with well-below-human accuracies of 55% and 60% on SocialIQa and ToMi, respectively. To conclude, we draw on theories from pragmatics to contextualize this shortcoming of large language models, by examining the limitations stemming from their data, neural architecture, and training paradigms. Challenging the prevalent narrative that only scale is needed, we posit that person-centric NLP approaches might be more effective towards neural Theory of Mind. In our updated version, we also analyze newer instruction tuned and RLFH models for neural ToM. We find that even ChatGPT and GPT-4 do not display emergent Theory of Mind; strikingly even GPT-4 performs only 60% accuracy on the ToMi questions related to mental states and realities.

研究の動機と目的

  • 大規模言語モデル(LLM)が現実世界の社会的推論タスクにおいて社会的知能およびマインド理論(ToM)の能力を示すかどうかを評価すること。
  • GPT-3 や GPT-3.5、GPT-4 といった最新の LLM が、社会的共通知識と心の状態の推論を測る二つのベンチマークタスクでいかに性能を示すかを評価すること。
  • LLM が ToM タスクで低い性能を示す主な要因を、学習データ、ニューラルアーキテクチャ、学習パラダイムの分析を通じて解明すること。
  • モデルのスケーリングのみで神経的マインド理論が得られるという一般的な主張に反論し、人間中心でインタラクティブな学習アプローチを提唱すること。
  • 現在の LLM が微調整や強化学習を経ても、堅牢な社会的知能を欠いているという実証的証拠を提供し、評価におけるデータの汚染のリスクに警告すること。

提案手法

  • 社会的意図、感情、反応に関する推論を測る SocialIQa ベンチマークで、GPT-3 および最新のインstructチューニング/RLHFモデル(例:GPT-3.5-Turbo、GPT-4)を評価した。
  • 複数のプローブ手法を適用:ゼロショットプロンプティング、フェイシングプロンプティング、複数選択プローブを用い、さまざまなプロンプティング戦略におけるモデル性能を評価した。
  • Sally-Ann の誤った信念テストを模した ToMi ベンチマークで、他者の心の状態や現実に関する推論能力を測定した。
  • 主な登場人物と二次的参加者との違いに注目し、中心化または注意のバイアスが生じていないかを検出するため、質問タイプごとのパフォーマンス差を分析した。
  • 統計的分析により、ランダムな選択(33%)および人間のパフォーマンス(ToMi では 90–100%、SocialIQa では 85% 以上)と比較した。
  • GPT-4 の学習データに SocialIQa や ToMi のテスト例が含まれていた可能性があるとして、データ漏洩のリスクを指摘し、高いパフォーマンスの主張の妥当性を疑問視した。

実験結果

リサーチクエスチョン

  • RQ1GPT-3 などの大規模言語モデルは、日常的な人間関係における社会的意図や感情反応について、どの程度推論できるか?
  • RQ2ToMi ベンチマークで測定されるように、LLM は他者の心の状態や誤った信念を正確に推論できるか?
  • RQ3インstructチューニングや人間フィードバックによる強化学習(RLHF)は、標準的な言語モデリングに比べ、LLM の社会的推論能力を向上させるか?
  • RQ4LLM が人間水準のマインド理論に到達できない主な制限要因(データ、アーキテクチャ、学習パラダイム)は何か?
  • RQ5GPT-3.5 や GPT-4 といった最新モデルで観察されたパフォーマンス向上は、真の推論能力の向上によるものか、それともベンチマークデータセットからのデータ汚染によるものか?

主な発見

  • GPT-3 は、社会的共通知識と感情知能を測る SocialIQa ベンチマークでわずか 55% の正確性を示し、人間の性能より 30% 以上も低い。
  • 心の状態や誤った信念をテストする ToMi ベンチマークでは、GPT-3 が 60% の正確性を記録したが、これはランダム選択(33%)よりわずかに 10% 高いにとどまり、人間の 90–100% とは大きくかけ離れている。
  • インstructチューニングおよび RLHF ファインチューニングされたモデル(例:GPT-3.5-RLHF)は SocialIQa で 55% まで向上したが、依然として人間水準の推論には至っていない。
  • GPT-4 は SocialIQa で 79.3% を達成し、人間の性能に 10% 以内に近づいたが、これは学習データに潜在的なデータ漏洩がある可能性があるため、スコアが誇張されている可能性がある。
  • ToMi では、GPT-3.5-Turbo が心の状態に関する質問で 60% の正確性を示し、GPT-4(59%)をわずかに上回った。これは、このタスクではスケーリングによる一貫した向上が見られないことを示している。
  • すべてのモデルが、主な登場人物に関する質問よりも二次的参加者に関する質問で著しくパフォーマンスが低いことが判明し、推論における継続的な中心化または注意バイアスが存在することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。