[論文レビュー] Post Hoc Explanations of Language Models Can Improve Language Models
本稿では、人為的ラベル付きの根拠(rationale)に依存せず、後向きに得られる説明手法(例:勾配に基づく帰属度)から自然言語の根拠を自動生成することで、大規模言語モデル(LLMs)の性能を向上させるフレームワークであるAMPLIFYを紹介する。より小さなプロキシモデルを用いて説明を計算し、それを是正プロンプトとして統合することで、多様な推論および理解タスクにおいてLLMの性能を10–25%向上させ、人為的ラベル付き手法(例:Chain-of-Thought prompting)を上回る。
Large Language Models (LLMs) have demonstrated remarkable capabilities in performing complex tasks. Moreover, recent research has shown that incorporating human-annotated rationales (e.g., Chain-of-Thought prompting) during in-context learning can significantly enhance the performance of these models, particularly on tasks that require reasoning capabilities. However, incorporating such rationales poses challenges in terms of scalability as this requires a high degree of human involvement. In this work, we present a novel framework, Amplifying Model Performance by Leveraging In-Context Learning with Post Hoc Explanations (AMPLIFY), which addresses the aforementioned challenges by automating the process of rationale generation. To this end, we leverage post hoc explanation methods which output attribution scores (explanations) capturing the influence of each of the input features on model predictions. More specifically, we construct automated natural language rationales that embed insights from post hoc explanations to provide corrective signals to LLMs. Extensive experimentation with real-world datasets demonstrates that our framework, AMPLIFY, leads to prediction accuracy improvements of about 10-25% over a wide range of tasks, including those where prior approaches which rely on human-annotated rationales such as Chain-of-Thought prompting fall short. Our work makes one of the first attempts at highlighting the potential of post hoc explanations as valuable tools for enhancing the effectiveness of LLMs. Furthermore, we conduct additional empirical analyses and ablation studies to demonstrate the impact of each of the components of AMPLIFY, which, in turn, leads to critical insights for refining in-context learning.
研究の動機と目的
- LLMの文脈内学習における人為的ラベル付き根拠のスケーラビリティと高コスト問題を解決すること。
- 後向き説明手法が、LLMのための効果的で自動化された是正信号として機能できるかどうかを検討すること。
- より小さなプロキシモデルからの帰属度スコアを活用して、LLMの推論および予測精度を向上させるフレームワークを開発すること。
- 自動化された説明駆動型プロンプトが、Chain-of-Thoughtのような従来の人為的ラベル付きプロンプト技術を上回ることを実証すること。
提案手法
- LLMの予測で誤分類されたサンプルに対して、計算的に実行可能な小さなプロキシモデル(例:GPT-2、BERT)を用いて後向き説明を計算する。
- 誤分類された検証サンプルのうち、プロキシモデルが誤った予測に対して高い信頼度を持つものを選択し、影響力の高い誤り事例に焦点を当てる。
- 勾配に基づく説明手法(例:Gradient × Input やその対照的変種)を適用し、正解ラベルの予測に最も寄与する入力トークンを同定する。
- 上位の影響力を持つ語をプロンプトテンプレートに埋め込んで自然言語の根拠を構築する:'重要なキーワード:word1, word2, … および word5 は、[ラベル] を予測するための重要な手がかりです' とすることで、LLMを導く。
- 推論時において、その結果得られたfew-shotプロンプト(入力、ラベル、根拠)をターゲットLLMに与えて、予測精度を向上させる。
- GPT-3 や GPT-3.5 などのLLMを用いて、感情分類、常識的推論、因果判断など多様なNLPタスクでフレームワークを評価する。
実験結果
リサーチクエスチョン
- RQ1後向き説明手法を用いて、人為的ラベルなしで効果的な自動根拠を生成し、LLMの性能を向上させることは可能か?
- RQ2人為的ラベル付き根拠(例:Chain-of-Thought prompting)を用いたLLMと比較して、自動生成根拠を用いたLLMの性能はどの程度か?
- RQ3説明手法の選択(例:Gradient × Input と Integrated Gradients)が、LLMにおける性能向上に顕著な影響を及えるか?
- RQ4プロンプトテンプレートの変更、たとえば表現や句読点の違いに対して、フレームワークの性能はどの程度感受的か?
- RQ5後向き説明は、重要な入力の手がかりを無視することで生じる誤りから、LLMが回復するのをどの程度支援できるか?
主な発見
- AMPLIFYは、幅広いタスクにおいてLLMの予測精度を10–25%向上させ、ベースラインプロンプト手法を顕著に上回る。
- Chain-of-Thought promptingが失敗または性能を発揮しないタスクに対しても、一貫した性能向上を達成しており、その堅牢性を示している。
- Gradient × Input 及びその対照的変種が最も効果的な根拠を生成するが、異なる説明手法間でも性能は安定している。
- タスクの文脈に応じて根拠テンプレートを調整することで、明確な向上が得られる。例えば、因果判断タスクでは '典型的な人は〜と応えるだろう' を追加することで、Causal Judgmentデータセットで2.6%の精度向上が観察された。
- 定性的分析により、AMPLIFYがLLMが以前に無視していた重要な語に注目するのを支援することが確認された。例として、推論タスクにおける 'never supposed to touch' といった語が挙げられる。
- テンプレートのわずかな変更に対してもフレームワークの性能は頑健であるため、性能向上は提示の形式的特徴ではなく、説明の内容に起因していることが示唆される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。