[論文レビュー] TEMPERA: Test-Time Prompting via Reinforcement Learning
TEMPERAは、大規模言語モデルにおけるテスト時プロンプト編集のための強化学習ベースの手法を提案する。この手法により、指示、少数の例、および語彙化子を柔軟に変更することで、クエリに応じた動的なプロンプト最適化が可能になる。複数の自然言語処理タスクにおいて最先端の性能を達成し、標準的な微調整に比べて4倍のサンプル効率を発揮する。プロンプトチューニングや離散的プロンプト最適化手法に比べて顕著な改善が得られる。
Careful prompt design is critical to the use of large language models in zero-shot or few-shot learning. As a consequence, there is a growing interest in automated methods to design optimal prompts. In this work, we propose Test-time Prompt Editing using Reinforcement learning (TEMPERA). In contrast to prior prompt generation methods, TEMPERA can efficiently leverage prior knowledge, is adaptive to different queries and provides an interpretable prompt for every query. To achieve this, we design a novel action space that allows flexible editing of the initial prompts covering a wide set of commonly-used components like instructions, few-shot exemplars, and verbalizers. The proposed method achieves significant gains compared with recent SoTA approaches like prompt tuning, AutoPrompt, and RLPrompt, across a variety of tasks including sentiment analysis, topic classification, natural language inference, and reading comprehension. Our method achieves 5.33x on average improvement in sample efficiency when compared to the traditional fine-tuning methods.
研究の動機と目的
- 大規模言語モデルのプロンプト設計への感受性を軽減するため、テスト時にクエリ依存の動的プロンプト最適化を可能にすること。
- 従来の微調整に代わる適応的プロンプト編集を用いることで、少数の例学習におけるサンプル効率を向上させること。
- 構造的な編集アクション空間を用いることで、解釈可能性、柔軟性、実現可能性のバランスを取ること。
- 手動で設計された初期プロンプトから出発する学習可能な編集プロセスを用いて、人間の事前知識をプロンプト最適化に統合すること。
- GLUEやSuperGLUEを含む多様な自然言語処理ベンチマークで最先端の性能を達成し、最小限のハイパーパrameterチューニングで実現すること。
提案手法
- エージェントが事前に定義されたアクション空間を用いて初期プロンプトを編集することで、離散的プロンプト最適化を強化学習の問題として定式化する。
- 置換、挿入、削除といった自然言語操作を用いて、指示、コンテキスト例、語彙化子の編集を可能にする、新しいアクション空間を設計する。
- 編集前のプロンプトと編集後のプロンプトのスコア差を主な報酬信号として用い、学習の安定化のため報酬正規化を実施する。
- 候補となる編集内容や設計選択を注目することで、探索と方策学習を向上させる注目メカニズムを備えた方策ネットワークを採用する。
- 人間の事前知識を統合するために、手作業で作成されたプロンプトを初期化として用い、クエリごとに強化学習で改善を図る。
- 収束性と性能の向上を図るために、トレーニング中にカリキュラム学習と温度スケーリングを適用する。
実験結果
リサーチクエスチョン
- RQ1強化学習を用いたテスト時プロンプト編集は、多様な自然言語処理タスクにおいて、大規模言語モデルのゼロショットおよび少数の例学習性能を顕著に向上させることができるか?
- RQ2標準的な微調整や他のプロンプトチューニング手法と比較して、提案手法のサンプル効率はどの程度優れているか?
- RQ3編集アクション空間の柔軟性が、固定またはブラックボックス型プロンプト生成と比較して、性能向上にどの程度寄与しているか?
- RQ4少数の例の数やプロンプトプールのサイズの変化に対して、この手法はどの程度頑健か?
- RQ5意味的に整合性のある編集を保証しつつ、解釈可能性を維持したまま高い性能を維持できるか?
主な発見
- TEMPERAは、SST-2で少数の例学習微調整に比べて1.8%の絶対的向上、CRでは3.9%の向上を達成し、複数のベンチマークで最先端の性能を発揮した。
- 標準的な微調整に比べて平均で5.33倍のサンプル効率を向上させ、性能を同等に達成するのに4倍の少ない例数で実現した。
- コンテキスト例の数が増えるにつれて性能が一貫して向上(最大4例まで)したが、AG Newsでは入力長の制限により8例に達した段階で性能が低下した。
- プロンプトプールサイズの変化に対しても頑健であり、プールサイズを8から32に拡大した際、AG Newsでは最大0.6%のわずかな向上が得られた。
- 語彙化子の編集が性能向上に顕著な寄与を示し、AG Newsでは1.2%の向上をもたらした。これは、タスク固有のプロンプト設計における語彙化子の重要性を示している。
- アブレーションスタディの結果、語彙化子、指示、例の各編集コンponentが測定可能な価値を提供しており、いずれかを削除すると最終的な性能が低下することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。