Skip to main content
QUICK REVIEW

[論文レビュー] Reasoning with Language Model Prompting: A Survey

Shuofei Qiao, Yixin Ou|arXiv (Cornell University)|Dec 19, 2022
Topic Modeling被引用数 12
ひとこと要約

本サーベイは、大規模言語モデルのプロンプトによる推論に関する包括的な概要を提供し、手法を戦略強化型、プロセス最適化型、知識強化型の3つに分類する。チェーン・オブ・トゥーク(CoT)や自己一貫性プロンプトなどの技術が、算術的、常識的、記号的推論タスクにおける性能を顕著に向上させることを示しており、最先端のモデルはGSM8K や CommonsenseQA といったベンチマークで人間に近い性能を達成している。

ABSTRACT

Reasoning, as an essential ability for complex problem-solving, can provide back-end support for various real-world applications, such as medical diagnosis, negotiation, etc. This paper provides a comprehensive survey of cutting-edge research on reasoning with language model prompting. We introduce research works with comparisons and summaries and provide systematic resources to help beginners. We also discuss the potential reasons for emerging such reasoning abilities and highlight future research directions. Resources are available at https://github.com/zjunlp/Prompt4ReasoningPapers (updated periodically).

研究の動機と目的

  • 最近の言語モデルのプロンプトによる推論に関する進展を体系的に整理・分析すること。
  • 大規模言語モデルの推論能力を向上させるキーポンプト戦略を同定・分類すること。
  • 戦略強化型、プロセス最適化型、知識強化型のアプローチを含む、推論手法の構造的分類体系を提供すること。
  • 言語モデルの推論分野における未解決の課題と今後の研究方向性を強調すること。
  • 研究者や初心者を支援するためのキュレート済みのリソースとベンチマークを提供すること。

提案手法

  • 推論プロンプト手法を3つの主要カテゴリに分類する分類体系を提唱:戦略強化型、プロセス最適化型、知識強化型の推論。
  • 戦略強化型手法を、単一段階型(例:チェーン・オブ・トゥーク、ゼロショットCoT)と多段階型(例:least-to-most、self-ask)に分類。
  • 自己最適化(例:calibrator、人間-AIフィードバック)、アンサンブル最適化(例:自己一貫性、多様なサンプリング)、反復的最適化(例:Reflexion、self-refine)などのプロセス最適化技術を導入。
  • 外部エンジン統合をカバーし、コードインタプリタ(例:PAL、COCOGEN)や物理シミュレータ(例:Mind’s Eye)を活用して、外部ツールによる推論の強化を実現。
  • 暗黙的(例:生成された知識、ファインチューニング済みCoT)および明示的(例:論理ソルバー、vote-k)な知識統合を通じた知識強化型推論を検討。
  • GSM8K、CommonsenseQA、MATH などのベンチマークデータセットを用い、手法間の推論性能を評価・比較。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルが複雑な推論を実行できるようにする主なプロンプト戦略は何か?
  • RQ2チェーン・オブ・トゥーク、自己一貫性、ツール拡張型プロンプトなどの異なるプロンプト技術が、推論タスク全体でどのように性能を発揮するか?
  • RQ3外部知識やツール(例:コードインタプリタ、シミュレータ)は、推論能力の向上にどのような役割を果たすか?
  • RQ4特定のプロンプト戦略が、算術的、常識的、記号的推論といった多様な推論タスクにどのようにより良く一般化するのか?
  • RQ5現在のプロンプトによる推論アプローチにおける制限事項や未解決の課題は何か?今後の研究はどこに注力すべきか?

主な発見

  • チェーン・オブ・トゥークプロンプトは、GSM8K などの算術的タスクにおける推論性能を顕著に向上させ、少数例設定でも80%以上の正確性を達成している。
  • 自己一貫性および反復的精錬手法(例:Self-Refine、Reflexion)は、複数の推論経路を集約または精錬することで、推論の信頼性を向上させる。
  • コードインタプリタを活用するプロンプト(例:PAL、COCOGEN)は、実行可能なコードを生成・実行することで、記号的および数学的推論の正確性を高める。
  • ChatGPT は、文脈例なしのゼロショット設定でもGSM8K および CommonsenseQA で強力な推論を示し、段階的な説明と正しい答えを出力している。
  • Last Letter Concatenation などの記号的推論タスクでは、ChatGPT の性能が弱く、推論能力が推論タイプに一様に分布しているわけではないことが示された。
  • 本サーベイは、生成された知識や明示的知識の統合を通じた知識強化型プロンプトが、常識的および論理的推論ベンチマークでの推論を向上させることを同定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。