Skip to main content
QUICK REVIEW

[論文レビュー] LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models

Shibo Hao, Yi Gu|arXiv (Cornell University)|Apr 8, 2024
Natural Language Processing Techniques被引用数 4
ひとこと要約

この論文では、GPT-4を用いて最終回答を超える論理的正しさを評価することで、LLMが生成する推論チェーンの自動的でタスクに適応した評価フレームワークであるAutoRaceを紹介する。また、検索-報酬-世界モデルの定式化により推論アルゴリズムを統一的に標準化する、LLM Reasonersというライブラリも提示する。主な結果として、AutoRaceは最終回答のみの評価で見逃される不正なチェーンの70.4%を検出でき、Blocksworldタスクにおいて世界モデルを用いたRAPはToTを42%上回る。

ABSTRACT

Generating accurate step-by-step reasoning is essential for Large Language Models (LLMs) to address complex problems and enhance robustness and interpretability. Despite the flux of research on developing advanced reasoning approaches, systematically analyzing the diverse LLMs and reasoning strategies in generating reasoning chains remains a significant challenge. The difficulties stem from the lack of two key elements: (1) an automatic method for evaluating the generated reasoning chains on different tasks, and (2) a unified formalism and implementation of the diverse reasoning approaches for systematic comparison. This paper aims to close the gap: (1) We introduce AutoRace for fully automated reasoning chain evaluation. Existing metrics rely on expensive human annotations or pre-defined LLM prompts not adaptable to different tasks. In contrast, AutoRace automatically creates detailed evaluation criteria tailored for each task, and uses GPT-4 for accurate evaluation following the criteria. (2) We develop LLM Reasoners, a library for standardized modular implementation of existing and new reasoning algorithms, under a unified formulation of the search, reward, and world model components. With the new evaluation and library, (3) we conduct extensive study of different reasoning approaches (e.g., CoT, ToT, RAP). The analysis reveals interesting findings about different factors contributing to reasoning, including the reward-guidance, breadth-vs-depth in search, world model, and prompt formats, etc.

研究の動機と目的

  • LLMの推論チェーンに対する自動的でタスクに適応した評価の欠如に取り組む。現在のところ、高コストな人間によるアノテーションや、適応不能なプロンプトに依存している。
  • CoT、ToT、RAPなどの多様な推論アルゴリズムを、共通の形式主義によって統一し、体系的な比較と実装を可能にする。
  • 報酬誘導、探索の幅と深さ、世界モデルの使用、プロンプト設計といった、推論パフォーマンスに影響を与える要因を分析する。
  • GPT-4、Claude-3、Llama-2などの最先端LLMの推論能力を、最終回答の正確さに加えて推論の質の指標でも評価する。
  • 推論チェーンにおけるタスク固有の失敗モードを明らかにする。例えば、共通知識タスクにおいて、詳細すぎるプロンプトがRAPで事実の虚構を引き起こす。

提案手法

  • AutoRaceは、GPT-4を用いてLLMが生成する推論チェーンの誤りを要約することで、人間の参加なしに動的で適応的な評価が可能な、タスク固有の評価基準を自動生成する。
  • 得られた評価基準を用いて、GPT-4に推論チェーンの論理的整合性、事実の正確性、段階的整合性について、タスクごとに評価させる。
  • LLM Reasonersは、報酬関数、世界モデル、探索アルゴリズム(例:ビームサーチ、MCTS)をパrameter化した推論状態の探索プロセスとして推論を形式化する。
  • 報酬、世界モデル、探索のモジュラーかつ合成可能なコンponentsを提供し、標準化されたAPIと可視化機能を備え、再現性と拡張性を確保する。
  • 統一された定式化により、既存の手法(CoT、ToT、RAP)を3つのコアコンponentsの特定の設定にマッピング可能である。
  • フレームワークは、新しい推論アルゴリズムのプラグアンドプレイ統合を可能とし、設計要因に関する制御されたアブレーションスタディを可能にする。

実験結果

リサーチクエスチョン

  • RQ1人間がアノテートしたリファレンスや固定されたプロンプトに依存せずに、多様なタスクにおいて推論チェーンを自動的かつ正確に評価する方法は何か?
  • RQ2報酬誘導、探索戦略、世界モデル、プロンプト形式といった、LLMの推論品質に影響を与える主な設計要因は何か?
  • RQ3CoT、ToT、RAPなどの異なる推論アルゴリズムは、タスク全体を通じて推論チェーンの正しさと最終回答の正確さにおいて、どのように比較されるか?
  • RQ4GPT-4、Claude-3などの最先端LLMは、最終回答の正確さを超えて推論品質においてどの程度異なるのか。その違いの理由は何か?
  • RQ5世界モデルの導入は、長時間にわたる状態の追跡を要するタスクにおいて、推論パフォーマンスにどのように影響するか?

主な発見

  • AutoRaceは、最終回答のみの評価で見逃される不正な推論チェーンの70.4%を検出でき、人間の評価と強い相関を示している。
  • StrategyQAでは、正解の回答を出した推論チェーンの39%が論理的または事実上の誤りを含んでおり、推論固有の評価の必要性が浮き彫りになった。
  • Blocksworldタスクにおいて、世界モデルを用いたRAPはToTを42%上回り、明示的な状態追跡が長時間計画において推論を著しく向上させることを示した。
  • プロンプト形式は推論品質に大きく影響する:RAPの反復的で部分的な質問プロンプトは、特に共通知識タスクにおいて、事実の虚構(例:7,000のような誤った数値)を増加させる。
  • GPT-4 TurboとClaude-3 Opusは、全タスクで推論能力においてリーダー的地位を占め、GPT-4はStrategyQAで類似した回答正確度を示しながらも、AutoRaceスコアが0.91と優れた推論品質を示した。
  • AutoRaceスコアによるモデルの順位は、最終回答のみの順位とは顕著に異なり、推論品質は回答の正確さを超えた独立した重要能力であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。