[論文レビュー] Prompt Injection: Parameterization of Fixed Inputs
この論文では、推論時にプロンプトを末尾に追加する必要をなくし、固定プロンプトを言語モデルのパラメータに直接埋め込む Prompt Injection (PI) を提案する。Pseudo-INput Generation (PING) などの蒸留ベースの技術を用いることで、特に詳細なパーソナ記述やデータベーススキーマなどの長いプロンプトに対して、ベースライン手法と比較して最大280倍のFLOPs削減が達成される。
Recent works have shown that attaching prompts to the input is effective at conditioning Language Models (LM) to perform specific tasks. However, prompts are always included in the input text during inference, thus incurring substantial computational and memory overhead. Also, there is currently no straightforward method of utilizing prompts that are longer than the maximum input length of the LMs without incurring additional costs during inference. We propose Prompt Injection (PI), a novel formulation of injecting the prompt into the parameters of an LM to be an efficient alternative to attaching fixed prompts to the input. We show that in scenarios with long fixed prompts, PI can be up to 280 times more efficient in terms of total FLOPs than previous approaches. We further explore methodologies for PI and show promising results in persona-dependent conversation, semantic parsing, and zero-shot learning with task instructions. Through these explorations, we show that PI can be a promising direction for conditioning language models, especially in scenarios with long and fixed prompts.
研究の動機と目的
- 大規模言語モデルの推論時に、繰り返し固定プロンプトを入力系列に追加する際の計算およびメモリのオーバーヘッドを軽減すること。
- 詳細なパーソナ記述やデータベーススキーマのような長いプロンプトを扱う際、Transformerベースのモデルにおける固定入力長の制限を克服すること。
- 入力ベースのプロンプティングの代替として効率的な手法を開発し、プロンプトを直接モデルパラメータに埋め込むことで、推論を高速化すること。
- 継続的事前学習と、新しい蒸留アプローチ(PING)を含む、効果的なプロンプトインジェクション手法の開発を通じて、性能劣化を最小限に抑えること。
- 実世界のシナリオにおいて、長く固定されたプロンプト(例:13,000トークンを超えるウィキペディア記事)を対話モデルにインジェクションする可能性と効率性を実証すること。
提案手法
- 推論時に入力系列に含める必要がないように、事前学習済み言語モデルのパラメータに固定プロンプトを埋め込む、新しい定式化である Prompt Injection (PI) を提案する。
- Pseudo-INput Generation (PING) と呼ばれる蒸留ベースのアプローチを用い、モデルがプロンプトに条件づけられた疑似入力を生成し、明示的にプロンプトを入力に含めたモデルの挙動を模倣するように微調整する。
- ベースライン手法として、プロンプトを入力系列に追加した合成データ上で微調整する継続的事前学習を適用する。
- プロンプトに依存する生成と知識蒸留を組み合わせて PI モデルを訓練し、明示的にプロンプトを付加したモデルの出力分布と一致させる。
- PI の評価を、パーソナ依存対話、意味解析、タスク指示を用いたゼロショット学習の多様なタスクで行い、制約なし(プロンプトを入力に含む)およびベースライン(プロンプトなし)モデルと比較する。
- PING を用いて、T5-large に長大なプロンプト(例:13,000トークン以上のウィキペディア記事)をインジェクションし、実世界の設定における実現可能性と効率性を示す。
実験結果
リサーチクエスチョン
- RQ1長大なプロンプトを扱う際、従来の入力ベースのプロンプティングと比較して、モデルパラメータへのプロンプトインジェクションが推論時のFLOPsを著しく削減できるか?
- RQ2継続的事前学習や PING といった異なる PI メソッドは、入力プロンプトのオーバーヘッドを排除しつつ、下流タスクの性能をどれほど維持できるか?
- RQ3詳細なパーソナ記述や完全なウィキペディア記事のような長大で固定されたプロンプトを、性能劣化を最小限に抑えながら処理できるか?
- RQ4PI と上限性能(入力に明示的なプロンプトを含む)との性能差に影響を与える要因は何か?また、入力の複雑さと構造は、この差にどのように影響するか?
- RQ5パーソナベースの対話、意味解析、ゼロショットインstructチューニングなど、多様なNLPタスクに PI を効果的に適用できるか?
主な発見
- Prompt Injection (PI) は、Fusion-in-Decoder や Linear Transformer といったベースライン手法と比較して、長大なプロンプトを扱う際、合計FLOPsを最大280倍まで削減した。
- Pseudo-INput Generation (PING) は、上限性能(入力に明示的なプロンプトを含む)に近く、継続的事前学習や制約なしモデルと比較して、WSC や PERSONA-CHAT などのタスクで優れた性能を発揮した。
- パーソナ依存対話タスクでは、PING は上限性能とほぼ同等の性能を達成し、長大なパーソナ記述の効果的なインジェクションを示した。
- COPA や RTE のような複雑な入力構造では、PING は疑似入力生成の品質が低いため性能が劣り、入力の複雑さに敏感であることが示された。
- 継続的事前学習ベースライン(CP)は、プロンプトなしの状態と比較してわずかな向上を示したが、カリキュラム学習を適用した CP(CP w/ curr)は、一部のケースで上限性能を上回る性能を示した(RTE で顕著)。
- 実世界の事例として、PING を用いて T5-large モデルに 13,000トークンを超えるウィキペディア記事(イーロン・マスク)を効果的にインジェクションし、入力プロンプトのオーバーヘッドなしに正確なパーソナベースの応答を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。