Skip to main content
QUICK REVIEW

[論文レビュー] Prototypical Calibration for Few-shot Learning of Language Models

Zhixiong Han, Yaru Hao|arXiv (Cornell University)|May 20, 2022
Topic Modeling被引用数 10
ひとこと要約

本稿では、真のラベルごとにモデル出力をクラスタリングするためのガウス・ミックス・モデルを用いて、堅牢で適応可能な意思決定境界を学習する、プロトタイプ補正(ProCa)を提案する。この手法により、9つのデータセット全体で13%の絶対的精度向上を達成し、プロンプトテンプレート、デモンストレーションの順序変更、クラス不均衡に対する耐性が著しく向上する。

ABSTRACT

In-context learning of GPT-like models has been recognized as fragile across different hand-crafted templates, and demonstration permutations. In this work, we propose prototypical calibration to adaptively learn a more robust decision boundary for zero- and few-shot classification, instead of greedy decoding. Concretely, our method first adopts Gaussian mixture distribution to estimate the prototypical clusters for all categories. Then we assign each cluster to the corresponding label by solving a weighted bipartite matching problem. Given an example, its prediction is calibrated by the likelihood of prototypical clusters. Experimental results show that prototypical calibration yields a substantial improvement on a diverse set of tasks. Extensive analysis across different scales also indicates that our method calibrates the decision boundary as expected, greatly improving the robustness of GPT to templates, permutations, and class imbalance.

研究の動機と目的

  • 異なるプロンプトやデモンストレーションに対して脆弱な意思決定境界が生じるため、大規模言語モデルにおける文脈内学習の不安定性を解消すること。
  • 分布シフトが生じた場合でも、従来のグリーディデコード(最大確率)がクラスを効果的に区別できないことの特定。
  • 各クラスのモデル出力のプロトタイプクラスタをモデル化することで、より堅牢な意思決定境界を学習する手法の開発。
  • 生のロジットではなく、学習済みのプロトタイプ分布からの尤度を用いて予測を補正することで、少数-shot一般化を向上させること。
  • ゼロ-shotおよび少数-shot設定における、さまざまなテンプレート、デモンストレーション順序、クラス不均衡に対して一貫性と耐性を確保すること。

提案手法

  • 同じ正解ラベルを持つ例の予測分布を、ガウス・ミックス・モデル(GMM)を用いてプロトタイプクラスタとしてモデル化する。
  • クラスタのラベル割り当てにおける曖昧性を解消するため、重み付き二部マッチングを用いて各推定クラスタをラベルに割り当てる。
  • 各例の予測を、各クラスのプロトタイプ分布における尤度を計算することで補正する。
  • クラスタ-ラベル対応を精緻化するため、最尤推定とアサインメントスコア(式4)の2つの推定戦略を用いる。
  • コンテンツフリーな入力を必要とせず、デモンストレーションの全体的な出力分布に基づいて意思決定境界を適応的に学習する。
  • 標準的な0.5の閾値や最大確率ルールよりも、より判別力の高い意思決定境界を最適化する。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルを用いた文脈内学習が、なぜプロンプトテンプレートやデモンストレーション順序の変更に対して高い感受性を示すのか。
  • RQ2グリーディデコードを上回る少数-shot分類性能を実現するため、モデル出力からより堅牢な意思決定境界を学習できるか。
  • RQ3モデル予測のプロトタイプクラスタリングが、さまざまなプロンプトフォーマットやクラス不均衡の下で一般化性能をどのように向上させるか。
  • RQ4提案手法による補正が、モデルのインダクティブバイアスやプロンプト工学的バイアスをどの程度軽減するか。
  • RQ5過学習を避けるために、信頼性のあるプロトタイプ補正を達成するための推定セットの最適サイズは何か。

主な発見

  • ProCaは、GPT-2およびGPT-Jモデルを用いた9つのテキスト分類データセットにおいて、標準的なグリーディデコードよりも平均で13%の絶対的精度向上を達成した。
  • AGNewsおよびDBPediaでは、アサインメントスコア戦略を用いたProCaが、1ショット性能をそれぞれ最大14.5%および12.0%向上させ、文脈的補正を上回った。
  • 小さな推定セット(例:4〜8例)でも、ProCaはほぼ最適な性能を達成でき、特定のサイズを超えると利得が減少する。
  • 補正された意思決定境界は、プロンプトの変更やデモンストレーション順序の変更に対する耐性を著しく向上させ、さまざまな設定間での性能ばらつきを低減した。
  • SST-2、MR、Subjにおいて、ProCaは最大尤度および文脈的補正のベースラインを上回ったが、例数がわずかであっても同様の結果を示した。
  • 予測分布の明確な分離(図2)が示されるように、この手法はモデルバイアスを効果的に低減し、クラス間の判別能力を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。