[論文レビュー] The Neuro-Symbolic Inverse Planning Engine (NIPE): Modeling Probabilistic Social Inferences from Linguistic Inputs
本稿では、自然言語記述を記号的プログラム意味論に翻訳する大規模言語モデル(LLM)を用い、ベイジアン確率的生成モデルの条件付けに活用することで、目的推論を実行するハイブリッドモデルであるNeuro-Symbolic Inverse Planning Engine(NIPE)を紹介する。NIPEは、空間的およびルールベースの障害物コースのシナリオを含む、複雑な社会的推論タスクにおける人間の判断を予測する際、LLM単体よりも優れた性能を示す。
Human beings are social creatures. We routinely reason about other agents, and a crucial component of this social reasoning is inferring people's goals as we learn about their actions. In many settings, we can perform intuitive but reliable goal inference from language descriptions of agents, actions, and the background environments. In this paper, we study this process of language driving and influencing social reasoning in a probabilistic goal inference domain. We propose a neuro-symbolic model that carries out goal inference from linguistic inputs of agent scenarios. The "neuro" part is a large language model (LLM) that translates language descriptions to code representations, and the "symbolic" part is a Bayesian inverse planning engine. To test our model, we design and run a human experiment on a linguistic goal inference task. Our model closely matches human response patterns and better predicts human judgements than using an LLM alone.
研究の動機と目的
- 自然言語入力から人間らしく社会的推論を行うための、特に複雑で動的な環境におけるエージェントの目的をモデル化すること。
- 純粋にニューラルなLLMが、合理的で目的指向の計画および効率的な経路推論を捉えることの限界を克服すること。
- 記号的ベイジアン逆計画法とニューラル言語モデルを統合することで、より構造的で解釈可能かつ正確な社會的推論を実現すること。
- ニューラル言語理解と記号的確率的推論を組み合わせることで、人間の直感的判断の予測性能が向上するかどうかを検証すること。
- 自然言語記述に基づいてスケーラブルで言語的根拠を持つ、AIエージェントにおける心の理論をモデル化するフレームワークを構築すること。
提案手法
- 大規模言語モデル(LLM)を用い、環境、エージェントの行動、世界のダイナミクスに関する自然言語記述を実行可能なか記号的プログラム表現に変換する。
- 言語的入力を、可能な世界状態およびエージェント行動の確率的生成モデルを条件づける構造的記号的意味論に翻訳する。
- 記号的意味論を条件として、可能な環境およびエージェント計画の事前分布を定義する。
- 観察された行動と世界制約から逆方向に推論することで、エージェントの最も可能性の高い目的を特定するベイジアン逆計画法を適用する。
- 効率性および制約の仮定の下で合理的で目的指向の行動をシミュレートするため、逆計画プロセス内にネストされたプランナを採用する。
- ロックされたドアと複数のトロフィを備えたゲーム番組の障害物コースを模した、独自の言語的目的推論タスクでモデルを訓練および評価する。

実験結果
リサーチクエスチョン
- RQ1神経記号的モデルは、複雑な社會的推論シナリオにおいて、LLM単体よりも人間の直感的目的推論をよりよく予測できるか?
- RQ2LLM単体は、より遠くの目標を追求する際、近い目標を無視するような非直感的な合理的計画をどれほど適切に処理できるか?
- RQ3記号的ベイジアン逆計画法は、空間的タスクにおけるエージェントの効率性および目的指向性の推論をどの程度改善するか?
- RQ4世界ダイナミクス、行動、構成に関する言語的入力が、確率的フレームワーク内でどのように共同して目的推論に影響を与えるか?
- RQ5ニューラル言語理解と記号的確率的推論を統合したハイブリッド神経記号的システムは、エンドツーエンドのニューラルモデルに比べ、より一貫性があり構造的で人間と整合性の取れる社會的推論を生み出せるか?
主な発見
- NIPEは、ロックされたドアと複数のトロフィを備えた複雑な障害物コースを含む言語的目的推論タスクにおいて、人間の反応パターンをよく再現する。
- NIPEは、GPT-4を含むLLMベースラインよりも、特に空間的および色別異常(Color-Different)ドメインのような複雑なバージョンにおいて、人間の判断を顕著に上回る性能を示す。
- 空間的バージョンでは、効率的な経路計画が求められるため、LLMは誤ってエージェントが近いトロフィ(例:銀)を標的にしていると予測するが、人間およびNIPEは正しく、エージェントがより遠くの目標(例:銅)を狙っていると推論する。これは、NIPEが合理的な計画をモデル化できる能力を示している。
- LLMベースラインは、色別異常バージョンにおいて人間の判断とほぼ相関がゼロであるため、世界ダイナミクスに関する抽象的ルールを一貫して適用できていないことが示唆される。
- NIPEは、すべての4つのタスクバージョンで人間の判断と強い相関を示しており、言語的および構造的複雑さに対して高い耐性を示している。
- 定性的分析から、NIPEは合理性と効率性に基づいて目的を正しく推論しているのに対し、LLMはしばしば距離や認識される価値(例:ゴールド対シルバーのトロフィ)といった表面的特徴に依存していることが明らかになった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。