[論文レビュー] On the Relation between Sensitivity and Accuracy in In-context Learning
本論文では、ラベルバイアスのため、インコントラスト学習(ICL)モデルが従来の認識よりも著しくプロンプト摂動に対して感受性が強いことが特定され、感受性と精度の間に強い負の相関があることが判明した。信頼性を向上させるために、著者らは感受性の高い予測を避ける選択的予測手法SenSelを提案し、10のデータセットで自信ベースおよびエントロピー基準のベースラインを最大+4.1 AUCポイント上回った。
In-context learning (ICL) suffers from oversensitivity to the prompt, making it unreliable in real-world scenarios. We study the sensitivity of ICL with respect to multiple perturbation types. First, we find that label bias obscures the true sensitivity, and therefore prior work may have significantly underestimated ICL sensitivity. Second, we observe a strong negative correlation between ICL sensitivity and accuracy: predictions sensitive to perturbations are less likely to be correct. Motivated by these findings, we propose extsc{SenSel}, a few-shot selective prediction method that abstains from sensitive predictions. Experiments on ten classification datasets show that extsc{SenSel} consistently outperforms two commonly used confidence-based and entropy-based baselines on abstention decisions.
研究の動機と目的
- インコントラスト学習(ICL)モデルのプロンプト摂動に対する真の感受性を調査すること。これは、従来の研究がラベルバイアスのため、低く評価していた可能性がある。
- ICL予測の感受性と精度の関係を検討すること。特に、感受性の高い予測が誤りである可能性が高いかどうかを評価する。
- 感受性を信号として活用し、信頼性の低い予測を避ける選択的予測手法を開発すること。高リスクの応用分野における信頼性の向上を目的とする。
- 追加のラベル付きデータを必要としない少言語設定において、SenSelを既存の自信ベースおよびエントロピー基準の放棄手法と比較して評価すること。
提案手法
- 著者らは、指示の言い換え、ノイズの注入、インコントラスト例の再順序付けによってプロンプトを摂動させ、出力の変化を計算することでICL感受性を測定した。
- ラベルバイアスを是正するため、モデルの確率を調整するプロンプトキャリブレーション(PC)手法を用いた。これにより、プロンプトにかかわらず特定のラベルに傾倒する傾向を排除した。
- SenSelは、小さなプロンプト変更に対してモデル出力が著しく変化する場合に、その予測を避けるように例を選び出す。
- 感受性スコアの閾値を用いて放棄を決定する。微調整や追加モデルの必要がない。
- GPT-J-6BおよびGPT-Neo-2.7Bを用いて10の分類データセットで評価し、MaxProbおよびエントロピー基準のベースラインと性能を比較した。
- 放棄性能の評価には、カバレッジ-F1曲線とAUCスコアを用い、複数の少言語設定および摂動タイプで結果を報告した。
実験結果
リサーチクエスチョン
- RQ1ラベルバイアスはインコントラスト学習モデルの真の感受性をどのように隠蔽しており、従来の感受性推定はどの程度低く評価されているか?
- RQ2ICL予測の感受性と予測精度の間に測定可能な相関があるか。その強さと方向性は?
- RQ3プロンプト摂動に対する感受性は、少言語学習における選択的予測の信頼できる信号として機能するか?
- RQ4SenSelは、自信ベース(MaxProb)およびエントロピー基準の放棄手法と比較して、AUCおよびカバレッジ-F1性能でどの程度優れているか?
- RQ5感受性に基づく放棄と確率に基づく放棄は、特に感受性の高いタスクにおいて補完的か?
主な発見
- ラベルバイアスはICL感受性を顕著に低く評価しており、是正後は原始的な感受性と比べて最大2.8倍高い。
- ICL感受性と精度の間に強い負の相関が存在し、データセット全体でピアソン積率相関係数が-0.40まで低下する。
- SenSelは、選択的予測性能においてMaxProbおよびエントロピー基準のベースラインを最大+4.1 AUCポイント上回った。
- SenSelは、MaxProbが過敏すぎるモデル確率に依存するため失敗する感受性の高いタスクにおいて特に効果的である。
- SenSelとMaxProbは補完的である。SenSelは感受性の高いタスクで優れた性能を発揮するが、MaxProbは感受性の低いタスクで優れている。
- カバレッジ-F1曲線において、すべてのF1閾値で高いカバレッジ率を達成しており、さまざまな放棄のトレードオフにおいても堅牢な性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。