[論文レビュー] P-Adapters: Robustly Extracting Factual Information from Language Models with Diverse Prompts
P-Adaptersは、固定された大規模言語モデル(LLMs)の埋め込み層と最初のアテンション層の間に配置される軽量で学習可能なアダプタであり、自然言語プロンプトを最適化された連続的プロンプトに変換することで、事実情報抽出の精度を向上させる。自然言語プロンプティングのみに比べて、正確性は12–26%絶対値上昇し、一貫性は36–50%向上する。主な要因は、プロンプトの主題エンティティのLLM内埋め込みへのアクセスにある。
Recent work (e.g. LAMA (Petroni et al., 2019)) has found that the quality of the factual information extracted from Large Language Models (LLMs) depends on the prompts used to query them. This inconsistency is problematic because different users will query LLMs for the same information using different wording, but should receive the same, accurate responses regardless. In this work we aim to address this shortcoming by introducing P-Adapters: lightweight models that sit between the embedding layer and first attention layer of LLMs. They take LLM embeddings as input and output continuous prompts that are used to query the LLM. Additionally, we investigate Mixture of Experts (MoE) models that learn a set of continuous prompts ("experts") and select one to query the LLM. They require a separate classifier trained on human-annotated data to map natural language prompts to the continuous ones. P-Adapters perform comparably to the more complex MoE models in extracting factual information from BERT and RoBERTa while eliminating the need for additional annotations. P-Adapters show between 12-26% absolute improvement in precision and 36-50% absolute improvement in consistency over a baseline of only using natural language queries. Finally, we investigate what makes P-Adapters successful and conclude that a significant factor is access to the LLM's embeddings of the original natural language prompt, particularly the subject of the entity pair being queried.
研究の動機と目的
- 意味的に同等だが異なる表現を用いたプロンプトを用いた場合に生じる、LLMからの事実情報抽出における一貫性の欠如を是正すること。
- 推論時における関係アノテーションや主題の特定を必要とせず、自然言語プロンプトのみを用いる手法を開発すること。
- ユーザー中心の設定において、プロンプトのバリエーションが避けがたい状況下でも、固定LLMからの事実抽出のロバスト性と正確性を向上させること。
- LLMのプロンプト主題の内部埋め込みへのアクセスが、プロンプト適応手法の性能に顕著に寄与しているかどうかを調査すること。
提案手法
- P-Adaptersは、固定されたLLMの埋め込み層と最初のアテンション層の間に挿入される軽量なニューラルネットワークであり、入力埋め込みを受け取り、連続的プロンプトを出力する。
- アダプタは、訓練時における関係アノテーションや主題の特定を必要とせず、(プロンプト, 対象)ペアのみを用いてエンドツーエンドで学習される。
- モデルは、多様な自然言語プロンプトを、事実予測を向上させるための共通の最適な連続的プロンプト表現にマッピングするように学習する。
- 複数の表現で同じ事実を表すプロンプトが同じ予測対象にマッピングされることで、一貫性が暗黙的に促進される。
- 変種の1つであるPrefix P-Adapterは、学習可能なプレフィックストークンを用いて入力を条件づけるのに対し、Rewrite P-Adapterは連続空間内でプロンプトを再表現しようとする。
- 本手法は、関係固有のエキスパートプロンプトを選択するために関係アノテーションと主題の特定を必要とするMixture-of-Experts(MoE)モデルと比較される。
実験結果
リサーチクエスチョン
- RQ1推論時に関係アノテーションや主題の特定を必要とせず、固定LLMからの事実抽出を向上させることは可能か?
- RQ2LLMのプロンプト主題の内部埋め込みへのアクセスが、プロンプト適応手法の性能にどのように影響するか?
- RQ3軽量なアダプタモデルは、多様なプロンプト表現に対して、自然言語プロンプティングに比べて正確性と一貫性の面でどの程度優れているか?
- RQ4関係だけでなく、完全な自然言語プロンプトに基づいてアダプタを条件づけることで、より良い一般化性能が得られるか?
- RQ5より少ない監視信号を用いながらも、P-Adaptersが他のプロンプト最適化手法を上回る理由は何か?
主な発見
- P-Adaptersは、自然言語プロンプティングのみに比べて、事実抽出タスクで正確性に12–26%の絶対値上昇、一貫性に36–50%の絶対値上昇を達成する。
- LLMのプロンプト主題の埋め込みが利用可能でない場合、P-Adaptersの成功は顕著に低下するため、主題に依存する表現が不可欠であることが示された。
- 関係アノテーションや主題の特定を必要としないが、MoEモデルと同等の性能を達成する。
- Prefix P-Adapterの変種はMoEモデルに近い性能を達成しており、単純なプレフィックスチューニングが非常に有効である可能性を示唆している。
- 最適なプロンプトチューニングでさえ、分布内対象では50%の正確性、分布外対象では25%の正確性にとどまるため、プロンプト最適化に固有の限界があることが確認された。
- 本研究は、LLMの事実知識がプロンプトの表現に敏感であり、P-Adaptersによる学習可能な微小なプロンプト調整が信頼性を著しく向上させられることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。