[論文レビュー] Boosting Logical Reasoning in Large Language Models through a New Framework: The Graph of Thought
本論文は、推論経路を線形的または木構造的チェーンではなく、動的で相互接続されたグラフとしてモデル化することにより、大規模言語モデルの論理的推論能力を向上させる、Graph of Thought (GoT) と呼ばれる新しいプロンプティングフレームワークを紹介する。目標から双方向に推論を実行し、思考同士の接続を検証し、繰り返しグラフを精錬することで、GoTは24ポイント・ゲームで97%の正確性を達成し、GPT-4を89.7%上回り、SOTAのToTを23%上回った。これは、多段階論理的推論タスクにおける最先端のパフォーマンスを示している。
Recent advancements in large-scale models, such as GPT-4, have showcased remarkable capabilities in addressing standard queries. However, when facing complex problems that require multi-step logical reasoning, their accuracy dramatically decreases. Current research has explored the realm of extit{prompting engineering} to bolster the inferential capacities of these models. Our paper unveils a pioneering prompting technique, dubbed extit{Graph of Thoughts (GoT)}. Through testing on a trio of escalating challenges: the 24-point game, resolution of high-degree polynomial equations, and derivation of formulas for recursive sequences, our method outperformed GPT-4, achieving accuracy improvements of $89.7\%$, $86\%$, and $56\%$ for each respective task. Moreover, when juxtaposed with the state-of-the-art (SOTA) prompting method, extit{Tree of Thought (ToT)}, our approach registered an average accuracy boost of $23\%$, $24\%$, and $15\%$.
研究の動機と目的
- 複雑で構造化された問題において、大規模言語モデルが多段階論理的推論を実行するという、長年の限界を克服すること。
- Chain-of-Thought (CoT) や Tree-of-Thought (ToT) のような従来のプロンプティング手法が抱える階層的かつ線形的制約を克服すること。
- 双方向で相互接続された推論経路を許容することで、人間の認知プロセスに近い推論フレームワークを構築すること。
- 再帰的推論、式変換、代数的洞察を要するタスクにおける推論の正確性を向上させること。
提案手法
- 各ノードが思考または中間的推論ステップを表す、動的で非階層的なグラフとして推論をモデル化する。
- 初期条件ではなく、望ましい結果から推論を開始することで、目的指向の探索を可能にする。
- ノード間の遷移の論理的整合性と正しさを検証するチェックメカニズムにより、思考を接続する。
- 新たな知見に基づいて、有望な推論経路を再評価・再追加することで、繰り返しグラフを精錬する更新メカニズムを導入する。
- 導出の正確性を高めるために、変数変換や式の簡略化といった数学的ツールを統合する。
- 複数回の点検ラウンド(n)を伴う深さ制限付きの走査戦略を採用し、多様な推論経路を探索し、最も整合性の高いものを選択する。

実験結果
リサーチクエスチョン
- RQ1非階層的でグラフベースの推論構造は、複雑な論理的推論タスクにおいて、線形的または木構造的プロンプティングを上回ることができるか?
- RQ2解決策から逆方向に目的指向の推論を実行することで、前方のみの推論に比べ、大規模言語モデルの正確性がどのように向上するか?
- RQ3思考同士の接続を検証するメカニズムが、多段階推論における論理的誤りをどの程度低減できるか?
- RQ4複数回の点検ラウンドを伴う繰り返しグラフ精錬が、推論の結果を顕著に改善するか?
- RQ5グラフベースのフレームワーク内に数学的ツールを統合することで、代数的および再帰的推論問題におけるパフォーマンスがさらに向上するか?
主な発見
- GoTは24ポイント・ゲームで97%の正確性を達成し、GPT-4の7.3%を89.7ポイント上回り、SOTAのToTを23ポイント上回った。
- 高次多項式方程式の解法において、GoTはGPT-4に比べ86%の正確性向上を達成し、ToTに比べ24%向上した。
- 再帰的数列の公式導出において、数学的ツールを有効化したGoTは57%の正確性を達成し、ToTに比べ15ポイント向上、GPT-4に比べ56%向上した。
- 点検ラウンド数(n)の増加に伴い、GoTの性能が向上し、n=5で55%の正確性を達成、数学的ツールを有効化すると57%に上昇した。
- GoTは、3つのタスクすべてにおいてすべてのベースラインを上回り、多段階論理的推論において一貫した優位性を示した。
- 思考同士の接続を検証し、グラフ構造を繰り返し精錬する能力のおかげで、論理的不整合が顕著に低減され、解の質が向上した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。