[論文レビュー] Structured, flexible, and robust: benchmarking and improving large language models towards more human-like behavior in out-of-distribution reasoning tasks
この論文は、大規模言語モデル(LLMs)における分布外推論を評価するための新しいベンチマークを導入し、人間が計画立案および説明生成タスクにおいてLLMsを著しく上回ることを明らかにした。本研究では、LLMを用いて自然言語を構造的で記号的なプログラムに変換し、その後そのプログラムを記号的計画法で解くハイブリッドなParse-and-Solveモデルを提案している。このモデルは、純粋なLLMsと比較して、困難で分布外の問題において優れた耐性と性能を示している。
Human language offers a powerful window into our thoughts -- we tell stories, give explanations, and express our beliefs and goals through words. Abundant evidence also suggests that language plays a developmental role in structuring our learning. Here, we ask: how much of human-like thinking can be captured by learning statistical patterns in language alone? We first contribute a new challenge benchmark for comparing humans and distributional large language models (LLMs). Our benchmark contains two problem-solving domains (planning and explanation generation) and is designed to require generalization to new, out-of-distribution problems expressed in language. We find that humans are far more robust than LLMs on this benchmark. Next, we propose a hybrid Parse-and-Solve model, which augments distributional LLMs with a structured symbolic reasoning module. We find that this model shows more robust adaptation to out-of-distribution planning problems, demonstrating the promise of hybrid AI models for more human-like reasoning.
研究の動機と目的
- 大規模言語モデル(LLMs)が分布外推論タスクにどれほど一般化できるか、人間との比較を通じて評価すること。
- パターン検索を超えた柔軟で創造的な言語ベースの推論を測定できるベンチマークを開発すること。
- 分布的言語モデルと記号的推論を組み合わせたハイブリッドモデルを提案・評価し、耐性を向上させること。
- 構造的記号的推論が、新規で制約のある推論問題におけるLLMのパフォーマンスを向上させられるかを検証すること。
- 言語モデルのみが、人間の推論の背後にある認知的計算構造をどれだけ捉えられるかを検討すること。
提案手法
- ベンチマークは、共通の言語的パターンに依存しないようにするため、反復的制約生成パラダイムを用いて、新規で分布外の推論プロンプトを生成する。
- 人間の回答は、ベースラインと、徐々に制約が強化された2つの条件で収集され、創造的で非定型の応答を引き出す。
- Parse-and-Solve(P+S)モデルが提案され、LLMが合成文法を用いて自然言語プロンプトを形式的で実行可能なプログラムに変換する。
- 記号的ソルバー部は、制限されたアクション空間上で探索ベースの計画法を用いて、これらのプログラムを実行し、有効な計画を生成する。
- 性能は、さまざまな制約レベルにおける計画の正確性と耐性を測定することで評価され、P+Sモデルと純粋なLLMによる計画法ベースラインとを比較する。
- 統計的モデリング(LMER)を用いて、異なる制約条件におけるモデル間の性能と耐性を比較する。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、人間と比較してどれほど分布外推論タスクに一般化できるか?
- RQ2反復的制約生成は、共通の言語的パターンを避ける新規で創造的な推論応答を効果的に引き出せるか?
- RQ3言語を構造的記号的プログラムに変換するハイブリッドモデルは、困難で制約のある推論問題における耐性を向上させられるか?
- RQ4LLMが生成したプログラムに従って動作する記号的計画法の性能は、エンドツーエンドのLLMによる計画法と比較して、分布外設定でどのように異なるか?
- RQ5分布的言語モデルのみでは、人間らしい推論の構造を十分に捉えられていないとされる限界は何か?
主な発見
- 人間は、特に最も制約の強い条件下でLLMsを著しく上回っており、LLMsが分布外推論に苦労していることが示唆されている。
- LLM-as-plannerベースラインは、最も制約の強い条件下で問題を1つも解けず、新規な制約下での脆さが顕著に現れている。
- Parse-and-Solveモデルは、LLM-as-plannerベースラインと比較して、全体的なパフォーマンスで統計的に有意な差(p < 0.001)を示した。
- 両モデルとも、条件の変化に伴い類似した相対的なパフォーマンス低下を示しており、パースリング部が、非常に構成的または新規な目標にも一般化に苦労している可能性を示唆している。
- ハイブリッドモデルは制約に対してより高い耐性を示しており、記号的推論インターフェースが新規な推論シナリオへの適応を向上させることを示している。
- 結果から、分布的言語モデルのみでは、新規または複雑な文脈における人間の推論の構造を十分に捉えられていないことが示唆されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。