Skip to main content
QUICK REVIEW

[論文レビュー] Thinking Aloud: Dynamic Context Generation Improves Zero-Shot Reasoning Performance of GPT-2

Gregor Betz, Kyle Richardson|arXiv (Cornell University)|Mar 24, 2021
Topic Modeling参考文献 46被引用数 16
ひとこと要約

本稿では、GPT-2が自己のゼロショット推論性能を向上させるために、リアルタイムで推論文脈を生成する動的問題拡張を提案する。自己生成された意味的に整合性のある拡張文を入力文脈に追加することで、演繹的推論タスクにおいて最大24%の精度向上が達成され、その有効性は拡張文の整合性と問題の特徴に依存する。

ABSTRACT

Thinking aloud is an effective meta-cognitive strategy human reasoners apply to solve difficult problems. We suggest to improve the reasoning ability of pre-trained neural language models in a similar way, namely by expanding a task's context with problem elaborations that are dynamically generated by the language model itself. Our main result is that dynamic problem elaboration significantly improves the zero-shot performance of GPT-2 in a deductive reasoning and natural language inference task: While the model uses a syntactic heuristic for predicting an answer, it is capable (to some degree) of generating reasoned additional context which facilitates the successful application of its heuristic. We explore different ways of generating elaborations, including fewshot learning, and find that their relative performance varies with the specific problem characteristics (such as problem difficulty). Moreover, the effectiveness of an elaboration can be explained in terms of the degree to which the elaboration semantically coheres with the corresponding problem. In particular, elaborations that are most faithful to the original problem description may boost accuracy by up to 24%.

研究の動機と目的

  • 動的問題拡張(言語モデルが自ら推論文脈を生成するもの)がゼロショット推論性能を向上させるかどうかを調査すること。
  • 自己生成された拡張文が、演繹的推論の際のGPT-2の文法的ヒューリスティクスに起因するバイアスを軽減できるかどうかを評価すること。
  • 自由、少数の例、断片的という異なる拡張戦略が、問題の特徴に応じてどのように性能に影響を与えるかを分析すること。
  • 拡張文と元の問題との間の意味的整合性が、推論精度の向上を予測できるかどうかを検証すること。
  • 微調整なしに自己生成された文脈を通じて推論能力を自己強化する可能性を検討すること。

提案手法

  • 自己反映的な設定でGPT-2を用いて、回答の前に文脈を動的に生成する。
  • 3種類の拡張タイプを用いる:自由(非構造化生成)、少々の例(文脈内例)、断片的(断片的でタスク固有のクエリ)。
  • 同じGPT-2モデルに、拡張された文脈を入力として与え、ChainRulerデータセット上でゼロショット推論を実行する。
  • yes/noの回答を要する、マルチホップ自然言語帰納と演繹的推論タスクで性能を測定する。
  • ベースライン(拡張なし)との精度向上と、元の問題との整合性を評価することで、拡張の有効性を測定する。
  • オラクルベースの評価を用いて、拡張文の意味的忠実性の影響を分離して評価する。

実験結果

リサーチクエスチョン

  • RQ1動的問題拡張は、GPT-2の演繹的推論タスクにおけるゼロショット推論性能を顕著に向上させることができるか?
  • RQ2自由、少々の例、断片的という異なる拡張戦略の有効性は、問題の難易度や構造に応じてどのように変化するか?
  • RQ3拡張文と元の問題との意味的整合性が、性能向上をどれほど予測できるか?
  • RQ4問題記述に否定が含まれる場合、特定の拡張タイプの有用性に影響を与えるか?
  • RQ5自己生成された拡張文は、GPT-2の文法的ヒューリスティクスに起因する系統的バイアスを軽減できるか?

主な発見

  • 動的問題拡張により、GPT-2のゼロショット推論精度がChainRulerデータセットで最大24%向上し、最も忠実な断片的拡張が最も高い向上をもたらした。
  • 特に元の問題と意味的に整合性の高い拡張文は、拡張なしと比較して精度を24%向上させる。
  • 否定がない問題では、少々の例による拡張が優れた性能を示すが、全問題タイプにわたって一貫して他の手法を上回るとは限らない。
  • 異なる拡張タイプは、問題の特徴に応じてそれぞれ優れた性能を発揮するため、有効性は文脈依存である。
  • 拡張文の重複は欠陥ではなく、繰り返しの記述はモデルの自信を示し、推論ステップの強化を通じて性能向上に寄与する。
  • モデルのベースライン動作は、誘導要因や対象的反転が存在する際に系統的な誤りを引き起こす文法的ヒューリスティクスに依存しており、拡張がその影響を軽減するのを支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。