Skip to main content
QUICK REVIEW

[論文レビュー] Faithful Reasoning Using Large Language Models

Antonia Creswell, Murray Shanahan|arXiv (Cornell University)|Aug 30, 2022
Topic Modeling被引用数 38
ひとこと要約

本論文は忠実性を重視した推論フレームワーク(halter付きのSelection-Inferenceと価値ベースのビームサーチ)を提示し、解釈可能な推論経路を生成するとともに、ProofWriterとEntailmentBankQAデータセットで多段階の質問応答を改善します。

ABSTRACT

Although contemporary large language models (LMs) demonstrate impressive question-answering capabilities, their answers are typically the product of a single call to the model. This entails an unwelcome degree of opacity and compromises performance, especially on problems that are inherently multi-step. To address these limitations, we show how LMs can be made to perform faithful multi-step reasoning via a process whose causal structure mirrors the underlying logical structure of the problem. Our approach works by chaining together reasoning steps, where each step results from calls to two fine-tuned LMs, one for selection and one for inference, to produce a valid reasoning trace. Our method carries out a beam search through the space of reasoning traces to improve reasoning quality. We demonstrate the effectiveness of our model on multi-step logical deduction and scientific question-answering, showing that it outperforms baselines on final answer accuracy, and generates humanly interpretable reasoning traces whose validity can be checked by the user.

研究の動機と目的

  • 大規模言語モデル(LLMs)における解釈可能で忠実性の高い多段階推論の必要性を動機づける。
  • 推論 traces における論理的妥当性を映し出す順次連鎖型アーキテクチャ(Selection-Inference)を開発する。
  • 推論経路に依存して停止時と回答出力を決定する halting 機構を導入する(モデルの事前知識ではなく推論経路に依存)。
  • 高品質の推論経路を見つけるために価値関数に導かれたビームサーチを取り入れる。
  • Reasoning データセット上でシステムを評価し、最終回答の精度と推論経路の妥当性の改善を示す。)
  • method:[

提案手法

  • 2つのファインチューニング済みLLMが backbone を形成し、SelectionモデルとInferenceモデルが連なる推論ステップ列を作る。
  • halter LM は各ステップ後に現在の推論が回答に十分かを判断し、推論経路に依存する場合にのみ回答を返す。
  • 価値関数を用いるLMが部分的な推論経路を評価し、推論経路上のビームサーチを導く。上位の推論経路を選択して継続させる。
  • 文のラベルを使って文脈から文を選択し、幻覚を防ぐ。推論ステップは選択された文から含意を予測する。
  • 推論経路は論理含意に関して妥当性、連結性、正確性の観点で定義・評価される。
  • 本システムは2段階の Halter を用いて、推論経路が不十分な場合には Unknown を宣言するか、そうでなければ回答を生成する。
  • ビームサーチはP候補ステップで展開し、各深さで上位B本の経路だけを残して推論経路の木を探索する。

実験結果

リサーチクエスチョン

  • RQ1選択と推論ステップを伴う前向き連鎖型推論システムは、妥当で検証可能な推論経路を生み出すだろうか?
  • RQ2推論経路の十分性に基づいて Answer または Unknown を出力する halting 機構は精度を向上させるだろうか?
  • RQ3価値関数に導かれたビームサーチは、ベースラインより最終回答の精度と推論経路の品質を改善するだろうか?
  • RQ4忠実な推論経路は、従来手法と比較して幻覚を減らし、文脈の利用を改善するだろうか?

主な発見

  • SI+Halter+Search 構成は、ベースラインと比較して PW(88.1%)および EB(78.1%)で高い最終回答精度を達成する。
  • SI はベースラインより高品質な推論経路を生み出し、EntailmentBankQAとProofWriterデータセットで偽情報への halting 発生率を低減する。
  • halter は回答を知っているときに信頼性高く予測し、Unknown ケースのフィルタリングを可能にして精度を大幅に向上させる。
  • 価値関数に誘導されたビームサーチは、特に深い推論(PW depth-5)および妨害要素がある EB で性能を向上させる。
  • ベースラインモデルは幻覚を多く起こし、提供された文脈や推論経路への依存が低い傾向がある。一方、SI+Halterは推論経路の妥当性と推論経路主導の回答においてより良いことを示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。