[論文レビュー] InfoPrompt: Information-Theoretic Soft Prompt Tuning for Natural Language Understanding
InfoPromptは、プロンプトとモデルパラメータまたは表現の間の相互情報量を最大化することで、情報理論的フレームワークに基づくソフトプロンプトチューニングを提案する。2つの新しい相互情報量に基づく損失関数を用いて、プロンプト初期化と表現認識を改善する。これにより、少サンプルNLPタスクにおける従来のプロンプトチューニング手法と比較して、収束が速く、性能が優れている。
Soft prompt tuning achieves superior performances across a wide range of few-shot tasks. However, the performances of prompt tuning can be highly sensitive to the initialization of the prompts. We also empirically observe that conventional prompt tuning methods cannot encode and learn sufficient task-relevant information from prompt tokens. In this work, we develop an information-theoretic framework that formulates soft prompt tuning as maximizing mutual information between prompts and other model parameters (or encoded representations). This novel view helps us to develop a more efficient, accurate and robust soft prompt tuning method InfoPrompt. With this framework, we develop two novel mutual information based loss functions, to (i) discover proper prompt initialization for the downstream tasks and learn sufficient task-relevant information from prompt tokens and (ii) encourage the output representation from the pretrained language model to be more aware of the task-relevant information captured in the learnt prompt. Extensive experiments validate that InfoPrompt can significantly accelerate the convergence of the prompt tuning and outperform traditional prompt tuning methods. Finally, we provide a formal theoretical result for showing to show that gradient descent type algorithm can be used to train our mutual information loss.
研究の動機と目的
- ソフトプロンプトチューニングの初期化に依存する感度と、プロンプトトークンからタスク関連情報の学習が限定的であるという問題に取り組む。
- プロンプトチューニングをプロンプトとモデルコンponents間の相互情報量の最大化として定式化する統一された情報理論的フレームワークを構築する。
- プロンプト初期化を導くと同時に、タスク関連情報の表現認識を高める2つの新しい損失関数を設計する。
- 提案された相互情報量損失に対する勾配降下法の収束に関する理論的保証を提供する。
提案手法
- プロンプトトークンと言語モデルヘッド間の相互情報量を最大化することで、ソフトプロンプトチューニングを定式化し、タスク関連情報の符号化を向上させる。
- プロンプトと言語ヘッド間の相互情報量を最大化するヘッド損失を導入し、初期段階でのプロンプト学習を改善する。
- 入力コンテキストを条件として、プロンプトと符号化された表現間の条件付き相互情報量を最大化する表現損失を設計する。
- 標準的な勾配降下法を用いて両方の損失を最適化し、ヘッセ行列の解析とリプシッツ境界を用いて収束の理論的裏付けを提供する。
- ヘッセ行列の近似を用いた近似ニュートン法を活用し、行列のスパarsityと多対数時間計算量を活かして学習を加速する。
- 標準的な分類設定との互換性を維持するため、全体の目的関数に交差エントロピー損失を統合する。
実験結果
リサーチクエスチョン
- RQ1相互情報量の最大化は、ソフトプロンプトチューニングにおける初期化の改善と、ランダム初期化への感受性の低減に寄与するか?
- RQ2相互情報量の目的関数に最適化された場合、プロンプトトークンはタスク関連情報の効果的な符号化を可能にするか?
- RQ3プロンプトと表現間の条件付き相互情報量を最大化することで、下流タスクの性能が向上するか?
- RQ4相互情報量損失に対する勾配ベース最適化は、理論的に収束保証が得られるか?
主な発見
- InfoPromptは、特に低ショット設定において、従来の手法と比較してプロンプトチューニングの収束を顕著に加速する。
- 提案された相互情報量に基づく損失関数は、手作業で作成されたものや標準的な学習済みプロンプトと比較して、プロンプトと表現間の条件付き相互情報量(CMI)を高める。
- MRPCおよびSST-2のベンチマークにおいて、既存のソフトプロンプトチューニングベースラインを上回り、精度と頑健性の両方が向上する。
- 理論的解析により、ヘッセ行列とリプシッツ条件が有界である場合、勾配降下法を用いて相互情報量損失を学習可能であり、収束保証が得られることを確認した。
- 標準的なプロンプトチューニングと比較して、収束がより速く、多くのエポックを要する傾向がある。
- 実験的結果から、InfoPromptのプロンプトトークンは、CMIで測定したタスク関連情報の符号化が、ランダムまたはWARPで学習されたプロンプトと比較して顕著に優れていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。