[論文レビュー] ProSA: Assessing and Understanding the Prompt Sensitivity of LLMs
ProSAはPromptSensiScore (PSS) を導入し、LLMのインスタンスレベルのプロンプト感度を測定し、客観評価と主観評価の頑健性を分析し、感度をデコード信頼度と結びつける。
Large language models (LLMs) have demonstrated impressive capabilities across various tasks, but their performance is highly sensitive to the prompts utilized. This variability poses challenges for accurate assessment and user satisfaction. Current research frequently overlooks instance-level prompt variations and their implications on subjective evaluations. To address these shortcomings, we introduce ProSA, a framework designed to evaluate and comprehend prompt sensitivity in LLMs. ProSA incorporates a novel sensitivity metric, PromptSensiScore, and leverages decoding confidence to elucidate underlying mechanisms. Our extensive study, spanning multiple tasks, uncovers that prompt sensitivity fluctuates across datasets and models, with larger models exhibiting enhanced robustness. We observe that few-shot examples can alleviate this sensitivity issue, and subjective evaluations are also susceptible to prompt sensitivities, particularly in complex, reasoning-oriented tasks. Furthermore, our findings indicate that higher model confidence correlates with increased prompt robustness. We believe this work will serve as a helpful tool in studying prompt sensitivity of LLMs. The project is released at: https://github.com/open-compass/ProSA .
研究の動機と目的
- プロンプトがデータセットレベルではなくインスタンスレベルでLLMの応答にどのように影響するかを動機づけ、定量化する。
- 客観的評価と主観的評価のためのインスタンスレベル感度指標(PSS)を開発する。
- モデル、データセット、プロンプトスタイル間でプロンプト感度がどのように変化するかを調査する。
- デコード信頼度とプロンプト頑健性の関係を探る。
提案手法
- 同じインスタンスに対するすべてのプロンプト変種間の応答の平均的なペアワイズ差異としてPSSを定義する。
- 複数のオープンソースLLMとデータセットで客観的タスクにおけるPSSを評価する。
- 少数ショットプロンプトがプロンプト頑健性に与える影響を評価する。
- プロンプト書き直しを伴う LC AlpacaEval 2.0 および Arena Hard Auto を用いた主観的評価分析を実施する。
- デコード信頼度を用いてプロンプト感度の根本原因を分析する。

実験結果
リサーチクエスチョン
- RQ1データセットとモデルサイズに応じて、インスタンスレベルのプロンプト感度はどのように変化するか?
- RQ2少数ショットプロンプティングはプロンプト感度を低減し頑健性を高めるか?
- RQ3実践において、LLMのデコード信頼度とプロンプト頑健性の関係はどうなるか?
- RQ4主観的評価と客観的評価と比較して、プロンプト感度は主観評価でどのように現れるか?
- RQ5どのタスクカテゴリが高いまたは低いプロンプト感度を示すか?
主な発見
- プロンプト感度はデータセットとモデルによって異なり、より大きなモデルはしばしばより高い頑健性を示す。
- 少数ショットプロンプティングはプロンプト感度を低減し、特に0ショットから1ショットへの設定へ移行する際に顕著であり、より大きなモデルはショット数が増えると頑健性を獲得する。
- 主観的評価は複雑なタスクでより高い感度を示す一方、単純なタスクでは頑健性を示す。
- デコード信頼度は低いプロンプト感度と相関し、頑健性が基盤となるデコードダイナミクスを反映していることを示唆する。
- プロンプトのカテゴリは感度に影響を与え、知識量が多いタスクはコーディングや創造的タスクより頑健である傾向がある。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。