[論文レビュー] MuSR: Testing the Limits of Chain-of-thought with Multistep Soft Reasoning
MuSRは、神経記号的合成から自然言語へのパイプラインを用いて生成された自然言語の物語を用いて、大規模言語モデルにおけるマルチステップのソフトな推論を評価するための新しいベンチマークを導入する。このデータセットは、GPT-4のようなモデルに、複雑で日常的常識に富んだ物語(例:1000語の殺人ミステリー)を提示し、高度なプロンプティング技術が導入されても、依然としてチェーン・オブ・トゥークの推論に大きなギャップが存在することを明らかにする。
While large language models (LLMs) equipped with techniques like chain-of-thought prompting have demonstrated impressive capabilities, they still fall short in their ability to reason robustly in complex settings. However, evaluating LLM reasoning is challenging because system capabilities continue to grow while benchmark datasets for tasks like logical deduction have remained static. We introduce MuSR, a dataset for evaluating language models on multistep soft reasoning tasks specified in a natural language narrative. This dataset has two crucial features. First, it is created through a novel neurosymbolic synthetic-to-natural generation algorithm, enabling the construction of complex reasoning instances that challenge GPT-4 (e.g., murder mysteries roughly 1000 words in length) and which can be scaled further as more capable LLMs are released. Second, our dataset instances are free text narratives corresponding to real-world domains of reasoning; this makes it simultaneously much more challenging than other synthetically-crafted benchmarks while remaining realistic and tractable for human annotators to solve with high accuracy. We evaluate a range of LLMs and prompting techniques on this dataset and characterize the gaps that remain for techniques like chain-of-thought to perform robust reasoning.
研究の動機と目的
- 自然言語の物語とマルチステップの日常的常識的推論を組み合わせた、現実的で複雑な推論ベンチマークの不足を解消すること。
- ドメイン固有の事実から推論を生成する、事実整合的で人間が解ける推論ツリーに基づいた、スケーラブルな神経記号的データセット生成手法を開発すること。
- チェーン・オブ・トゥークのプロンプティングと神経記号的手法が、複雑で現実世界の推論タスクにおいてどれほど頑健に機能するかを評価すること。
- 高度なプロンプティング戦略が導入されても、最先端のLLMに依然として根強い推論のギャップが存在するかを特定すること。
提案手法
- 神経記号的合成から自然言語への生成パイプラインにより、まず推論ツリーを生成し、ドメイン固有の事実からマルチステップの推論をエンコードする。
- 推論ツリーは、正しい答えを導くために必要な日常的常識的推論をエンコードするために、LLMを用いて再帰的に拡張される。
- GPT-4を用いて繰り返しチャンク単位で物語が生成され、各段階で事実の整合性と記憶の正確性が検証される。
- このプロセスにより、物語の現実性と論理的整合性が保たれ、同時にコアな事実と推論経路が維持される。
- データセットは、殺人ミステリー、物の配置、チーム編成の3つのドメインにわたり構築され、いずれも深い日常的常識的推論とシステム2の推論を要する。
- 評価には、ゼロショットおよびフェイシング・チェーン・オブ・トゥークのプロンプティングに加え、神経記号的ベースラインが、ドメイン全体で750件のインスタンスに対して適用される。

実験結果
リサーチクエスチョン
- RQ1GPT-4のようなLLMは、明示的な中間監視なしに、長大で自然言語の物語から推論経路を信頼性高く回復できるか?
- RQ2チェーン・オブ・トゥークのプロンプティングと神経記号的手法は、複雑な物語に埋め込まれたマルチステップの日常的常識的推論タスクにおいて、どのように機能するか?
- RQ3現在のLLMは、持続的な注意と複数の事実の統合を要する物語に対して、どの程度推論が頑健でないか?
- RQ4神経記号的生成手法は、モデルの進化に伴い、より複雑な推論物語をどの程度スケーラブルに生成できるか?
主な発見
- GPT-4は、あらゆるプロンプティング戦略を用いても、最終的な物語から正しい推論経路を回復できない。これは、自然言語の物語に推論が堅牢にエンコードされていないことを示している。
- チェーン・オブ・トゥークのプロンプティングはMuSRにおいて限定的な改善を示し、最先端のモデルですら、依然として根強い推論ギャップが存在することを明らかにする。
- 神経記号的生成パイプラインは、事実整合的で人間が解ける、最大1000語の物語を効果的に生成でき、スケーラブルなベンチマーク作成を可能にする。
- このデータセットはルールベースのシステムでは解けないため、その複雑さと、高度な推論を評価するのに適した性質が確認される。
- 人間のアノテーターはMuSRのインスタンスを高い正確性で解いており、データセットの現実性と解読可能性が妥当であることが検証される。
- MuSRは、自然言語、マルチステップ推論、日常的常識、中間推論構造を統合することで、既存のベンチマークを上回る。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。