[論文レビュー] OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
OpenToM は、意図的な行動、明確な性格特性、および物理的世界と心理的心的状態の両方を対象とする多様な質問を備えた、自然で人格化された物語を特徴とする、大規模言語モデル(LLMs)におけるニューラル理論的マインド(N-ToM)推論を評価する新しいベンチマークである。研究では、LLMs が物理的世界の推論に関しては妥当に機能するが、心理的状態の追跡に関しては顕著に劣っていることが明らかになり、社会的認知能力における重要なギャップが露呈された。
Neural Theory-of-Mind (N-ToM), machine's ability to understand and keep track of the mental states of others, is pivotal in developing socially intelligent agents. However, prevalent N-ToM benchmarks have several shortcomings, including the presence of ambiguous and artificial narratives, absence of personality traits and preferences, a lack of questions addressing characters' psychological mental states, and limited diversity in the questions posed. In response to these issues, we construct OpenToM, a new benchmark for assessing N-ToM with (1) longer and clearer narrative stories, (2) characters with explicit personality traits, (3) actions that are triggered by character intentions, and (4) questions designed to challenge LLMs' capabilities of modeling characters' mental states of both the physical and psychological world. Using OpenToM, we reveal that state-of-the-art LLMs thrive at modeling certain aspects of mental states in the physical world but fall short when tracking characters' mental states in the psychological world.
研究の動機と目的
- 既存の N-ToM ベンチマークにおける課題、例えば人工的な物語、性格の欠如、曖昧な意図の欠如を是正すること。
- 物理的世界および心理的状態の両方におけるキャラクターの心的状態を推論できる能力を評価する包括的なベンチマークの開発。
- 四段階の LLM 補助付き人間によるフィードバックループパイプラインを用いて、人間が検証した高品質な物語を生成し、誤った手がかりを低減し、現実性を向上させること。
- 最先端の LLM が心理的推論タスクにおいてどのように機能するかを評価し、N-ToM 能力における継続的な制限を同定すること。
提案手法
- 四段階の人間によるフィードバックループパイプラインを採用する:(1) キャラクターに性格特性と好みを割り当てる、(2) 意図とそれに応じた行動(実行行動)を定義する、(3) LLM を用いて自然な物語を生成する、(4) 人間のアノテーターによるフィードバックを通じて物語の明確さと一貫性を向上させる。
- 物語に2人のプロトコルキャラクター、関心対象のエンティティ、複数の場所を含め、行動がキャラクターの意図と性格に基づくように設計する。
- 物語ごとに3種類の質問を構築する:(1) 位置に基づく(Loc)、(2) マルチホップ推論(MHop)、(3) 态度に基づく(Att)—心理的状態を対象とする。
- GPT-4 や Llama2、Mixtral などの多様な LLM に対してゼロショット評価を実施し、Chain-of-Thought や Simulated-ToM といったテストプロンプティング技術を用いる。
- 比較のためのファインチューニングベースラインを確立するために、Llama2-Chat-13B モデルをファインチューニングする。
- 語彙的重複などの誤った相関を低減する厳密な緩和戦略を適用し、真の N-ToM 推論の有効な評価を保証する。
実験結果
リサーチクエスチョン
- RQ1LLMs は、物語の文脈とキャラクターの意図に基づいて、エンティティの物理的世界における位置をどれほど正確に予測できるか?
- RQ2複雑な社会的物語において、LLMs はキャラクターの態度、信念、感情的反応といった心理的状態をどれほど適切に推論できるか?
- RQ3性格特性と意図的な行動が、テンプレートベースのベンチマークと比較して、LLMs の ToM 推論タスクにおけるパフォーマンスを向上させるか?
- RQ4高度なプロンプティング技術(例:Chain-of-Thought、SimToM)およびファインチューニングは、LLMs が心理的心的状態をモデル化する能力にどのように影響するか?
- RQ5LLMs が N-ToM 推論において示す主な失敗モードは何か。特に、忠実性の欠如、物語長への感受性、役割の曖昧さに関しては?
主な発見
- GPT-4 やファインチューニングされた Llama2-13B を含む最先端の LLM は、物理的世界の推論(例:物体の位置)において高い正確性を示すが、心理的状態に関する質問では著しくパフォーマンスが低下する。
- LLMs は顕著な推論能力の不均衡を示す:物理的世界の認識は強いが、心理的状態のモデル化は弱く、社会的認知における根本的なギャップを示している。
- Chain-of-Thought や SimToM といった高度なプロンプティングでさえ、LLMs がキャラクターの態度や信念を一貫して導出できないことは、心的状態追跡における本質的な制限を示唆している。
- モデルは推論において忠実性に欠け、物語の論理やキャラクターの心理に合致しないが、説得力のある誤った正当化を生成する傾向がある。
- パフォーマンスは物語の長さやキャラクターの役割に敏感であり、役割が曖昧であるか、物語が長く複雑である場合、モデルはより困難に直面する。
- ベンチマークは、現在の LLM が、たとえ人格化された自然な物語であっても、誤った手がかりに依存し、洗練された心理的認識を理解できない傾向にあることを明らかにした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。