Skip to main content
QUICK REVIEW

[論文レビュー] Maieutic Prompting: Logically Consistent Reasoning with Recursive Explanations

Jaehun Jung, Lianhui Qin|arXiv (Cornell University)|May 24, 2022
Topic Modeling被引用数 7
ひとこと要約

Maieutic prompting は、真/偽の両方の答えについて帰納的説明を再帰的に生成し、関連する命題の木構造を構築し、重み付き MAX-SAT を用いて矛盾を解消することで、大規模言語モデルにおける論理的整合性を向上させる、新しい少数-shot 推論手法である。説明がノイズ混じりや一貫性のない場合でも、共通の直感的推論ベンチマークにおいて、最先端のプロンプト手法よりも最大20%高い精度を達成する。

ABSTRACT

Despite their impressive capabilities, large pre-trained language models (LMs) struggle with consistent reasoning; recently, prompting LMs to generate explanations that self-guide the inference has emerged as a promising direction to amend this. However, these approaches are fundamentally bounded by the correctness of explanations, which themselves are often noisy and inconsistent. In this work, we develop Maieutic Prompting, which infers a correct answer to a question even from the noisy and inconsistent generations of LM. Maieutic Prompting induces a tree of explanations abductively (e.g. X is true, because ...) and recursively, then frames the inference as a satisfiability problem over these explanations and their logical relations. We test Maieutic Prompting for true/false QA on three challenging benchmarks that require complex commonsense reasoning. Maieutic Prompting achieves up to 20% better accuracy than state-of-the-art prompting methods, and as a fully unsupervised approach, performs competitively with supervised models. We also show that Maieutic Prompting improves robustness in inference while providing interpretable rationales.

研究の動機と目的

  • 説明に基づくプロンプト手法の根本的限界、すなわちモデルが生成する説明が論理的に一貫性がなかったり、事実に基づいていなかったりするという問題に対処すること。
  • モデル自身の説明がノイズ混じりや矛盾を含んでも、正しい答えを推論できるようにすること。
  • 自己生成された推論根拠を内蔵的に活用する完全な自己教師なし手法を開発し、推論の頑健性と解釈可能性を向上させること。
  • 命題間の論理的関係を、MAX-SAT を用いて記号的にモデル化し、矛盾を解消し、最も整合性のある推論を特定すること。
  • 複雑な共通の直感的推論および事実検証タスクにおいて、少数-shot プロンプトのベースラインと教師ありモデルを上回ること。

提案手法

  • 与えられた質問の真/偽の仮説の両方について、単一の説明ではなく、帰納的説明を生成させることで、言語モデルに誘導する。
  • モデル自身の説明を検証する再帰的プロンプトを用い、論理的依存関係を持つ命題の木構造的階層を生成する。
  • 各説明と元の質問を命題変数として扱い、信頼度スコアを信念強度として表現する。
  • 命題間の論理的関係(例:含意、矛盾)を重み付きクラウーズとして重み付き MAX-SAT の定式化にモデル化する。
  • 重み付き MAX-SAT ソルバーを用いて、満たされたクラウーズ数を最大化する真理値割り当てを特定し、論理的整合性を保証する。
  • 微調整や人間がアノテートした推論根拠を一切必要とせず、少数-shot プロンプトのみを用いて完全に自己教師なしでこの手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1モデル自身の整合性のない、あるいは誤りのある説明を活用することで、論理的に整合的かつ正しい答えを推論できるか?
  • RQ2自己生成された説明の木構造に対して記号的推論を施すことで、標準的な説明に基づくプロンプト手法を上回る推論精度が得られるか、その程度はどの程度か?
  • RQ3ベースライン手法と比較して、入力の質問やプロンプトに摂動が加えられた場合、Maieutic prompting はどの程度頑健か?
  • RQ4完全に自己教師なしの手法が、複雑な共通の直感的推論タスクにおいて、教師ありモデルと同等の性能を達成できるか?
  • RQ5Maieutic prompting が生成するモデルによる推論根拠は、人間がアノテートした根拠と比べて、質と整合性の点でどの程度か?

主な発見

  • Maieutic prompting は、3つの挑戦的な共通の直感的推論および事実検証ベンチマークにおいて、最先端の少数-shot プロンプト手法よりも最大20%高い精度を達成する。
  • 微調整や人間がアノテートした推論根拠が一切不要な状態でも、教師ありモデルと同等に性能を発揮する。
  • 誤って回答された例の42%の説明は事実として正しいものであり、23%は正しい答えを特定するのに完全に役立つものである。これは、適切に解消された場合、誤りのある説明にも価値があることを示している。
  • 入力の摂動(質問やプロンプトの変更)に対して、ベースラインを上回る頑健性を示し、敵対的・ノイズ混じりの条件下でも優れた性能を発揮する。
  • 生成された推論根拠は解釈可能で説得力があり、しばしば正解の根拠と同等か、それ以上の質を備えた一貫性のある論理的連鎖を形成する。
  • 説明の木構造全体にわたる矛盾を MAX-SAT を用いて解消することで、個々の説明の信頼度スコアに依存するのとは異なり、より一貫性があり信頼性の高い推論が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。