[論文レビュー] In-context Example Selection with Influences
本稿では、few-shot言語モデル性能に与える個々のin-context例の影響を定量化する手法であるin-context influence(イン・コンテキストインフルエンス)を導入する。再訓練に基づく影響推定をフォワードパスを用いて実行することで、高い影響(正の影響)と低い影響(負の影響)を持つ例を特定する。9つのSuperGLUEタスクにおいて、上位影響を持つ例を選択することで、下位影響を持つ例を選択する場合に比べ、最大16.3%の性能向上を達成し、ベースラインを上回る性能を示した。
In-context learning (ICL) is a powerful paradigm emerged from large language models (LLMs). Despite its promises, ICL performance is known to be highly sensitive to input examples. In this work, we use $ extit{in-context influences}$ to analyze few-shot ICL performance directly from the in-context examples. Our proposed influence-based example selection method can identify both positive and negative examples, outperforming several baselines when evaluated on 9 SuperGLUE tasks. Our analysis uncovers up to a $16.3\%$ performance gap between using the most negative in-context examples compared to the most positive. In a case study, we apply our influence-based framework to quantify the phenomena of recency bias in example ordering for few-shot ICL.
研究の動機と目的
- 個々のin-context例がfew-shot in-context learning (ICL)性能に与える影響を理解・定量化すること。
- モデル予測への影響に基づいて最適なin-context例を選択する、スケーラブルでオフラインな手法を開発すること。
- 例の選択および順序付けに起因するICL性能の変動、特にレシエンシー効果やマジョリティバイアスといった既知のバイアスの影響を分析すること。
- 分類以外のNLPタスクやモデルファミリーに対しても、影響フレームワークを一般化すること。
提案手法
- 本手法は、ICLに適応された再訓練に基づく影響フレームワークを用い、'学習'をin-context例の部分集合を用いたプロンプトへのフォワードパスによってシミュレートする。
- k-shotプロンプトのデータセットを、異なる例の部分集合を用いて構築し、その検証性能を測定することで影響を推定する。
- 影響スコアは、開発セットの例を用いて、部分集合の性能から個々の例の寄与を線形マッピングで学習することで算出される。
- フレームワークは任意の性能指標に一般化可能であり、例の順序付けを分析することで、レシエンシー効果のような位置効果を分析できる。
- 勾配計算を避けるため、LLMへのクエリアクセスを活用しており、標準的な影響手法と比較して計算が効率的である。

実験結果
リサーチクエスチョン
- RQ1個々のin-context例がfew-shot ICL性能にどのように影響を与えるか、その正または負の影響を定量化できるか?
- RQ2影響に基づく例選択は、意味的類似度やパープレキシティといった既存のベースラインを上回る効果的なin-context例の選択に寄与するか?
- RQ3ICLにおいて、最も影響力のある例と最も影響力のない例との間で、性能差はどの程度の大きさか?
- RQ4例の順序付けがICL性能に与える影響は何か?また、影響分析はレシエンシー効果を定量化できるか?
- RQ5in-context影響は、例のパープレキシティや埋め込み類似度といった既知の信号とどの程度相関するか?
主な発見
- 影響に基づく例選択は、9つのSuperGLUEタスクにおいて、正例・負例の両方の選択において、複数のベースラインを上回る性能を示した。
- LLaMA-13Bでは、最も正の影響を持つ例と最も負の影響を持つ例との間で、性能差が最大16.3%に達し、例の影響に顕著なばらつきがあることが示された。
- フレームワークはレシエンシー効果を効果的に定量化できており、特にk-shot設定が長い場合、後続に配置された例がより高い影響を持つことが明らかになった。
- 影響スコアは、例のパープレキシティや埋め込み類似度といった既知の信号とほとんど相関がなかったため、それとは異なる情報的で有用な信号を捉えていることが示された。
- 本手法は、複数のモデルファミリーおよびタスク(包括的分類および二値分類を含む)に一般化可能であり、特に包括的分類タスクでより顕著な向上が得られた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。