Skip to main content
QUICK REVIEW

[論文レビュー] An Empirical Study on Few-shot Knowledge Probing for Pretrained Language Models

Tianxing He, Kyunghyun Cho|arXiv (Cornell University)|Sep 6, 2021
Topic Modeling参考文献 26被引用数 5
ひとこと要約

この論文は、事前学習済み言語モデルにおける少数-shot知識プローブを調査し、微調整バイアスベクトル(BitFit)がプロンプト工学やコンテキスト内学習を著しく上回ることを提案している。新しい2ホップ関係データセット(TREx-2p)を用いて、わずか10–20の少数-shot例がゼロショット性能を顕著に向上させることを示しており、BitFitは最小限のパラメータでモデルを効果的に正則化することで、最先端の結果を達成している。

ABSTRACT

Prompt-based knowledge probing for 1-hop relations has been used to measure how much world knowledge is stored in pretrained language models. Existing work uses considerable amounts of data to tune the prompts for better performance. In this work, we compare a variety of approaches under a few-shot knowledge probing setting, where only a small number (e.g., 10 or 20) of example triples are available. In addition, we create a new dataset named TREx-2p, which contains 2-hop relations. We report that few-shot examples can strongly boost the probing performance for both 1-hop and 2-hop relations. In particular, we find that a simple-yet-effective approach of finetuning the bias vectors in the model outperforms existing prompt-engineering methods. Our dataset and code are available at \url{https://github.com/cloudygoose/fewshot_lama}.

研究の動機と目的

  • 限られた監視情報のもとで、事前学習済み言語モデルにおける少数-shot知識プローブを評価すること。
  • 少数-shot設定下で、プロンプト工学とモデル微調整のどちらがより優れた性能を発揮するかを調査すること。
  • 2ホップ関係的知識プローブ用の新しいベンチマークデータセット、TREx-2pを構築すること。
  • 少数-shot設定下での、コンテキスト内学習、連続的プロンプトチューニング(OptiPrompt)、およびパラメータ効率的微調整(BitFit)の有効性を評価すること。

提案手法

  • 著者らは、より複雑な知識プローブを評価するための新しいデータセットTREx-2pを導入した。
  • 複数の少数-shotプロンプティング戦略を比較した:手動テンプレート(manT)、マイニングされたテンプレート(mineT)、デフォルトテンプレート(defT)、コンテキスト内学習、OptiPrompt(連続的プロンプトチューニング)、およびモデル微調整。
  • BitFitは、最終層または隠れ層のバイアスベクトルのみを微調整することで、パラメータを最小限に抑え、過学習を低減する。
  • 性能評価には平均逆順位(MRR)を用い、過学習を防ぐために小規模な開発セットで早期停止を実施した。
  • OptiPromptは、学習可能な連続的プロンプトトークンを用いて、トレーニング中に入力プロンプトを動的に適応させる。
  • アブレーションスタディでは、フル微調整、BitFit、および制御ベースライン(出力層または隠れ層のバイアスのみ微調整)を比較し、バイアス微調整の効果を隔離した。

実験結果

リサーチクエスチョン

  • RQ1少数-shot例は、事前学習済み言語モデルにおけるゼロショット知識プローブ精度を顕著に向上させることができるか?
  • RQ2バイアスベクトルの微調整(BitFit)は、少数-shot知識プローブにおいてプロンプト工学やコンテキスト内学習を上回るか?
  • RQ31ホップおよび2ホップ関係において、少数-shotプロンプティングの性能はどのように変化するか、特に2ホップテンプレートの文法的複雑さが影響を及ぼすか?
  • RQ4連続的プロンプトチューニング(OptiPrompt)は、離散的マニュアルまたはマイニング済みテンプレートを上回るか?
  • RQ5マニュアルテンプレートとOptiPromptまたはBitFitを組み合わせることで追加の利得が得られるか?

主な発見

  • 10–20の少数-shot例が、1ホップおよび2ホップ関係の両方でプローブ精度を顕著に向上させ、約200例で性能が飽和する。
  • バイアスベクトルのみを微調整するBitFitは、最先端の性能を達成し、ほとんどの場合でフルモデル微調整やOptiPromptを上回る。
  • OptiPromptはマニュアルおよびマイニング済みテンプレートを上回り、連続的プロンプトチューニングが離散的テンプレートを上回る利点を確認した。
  • コンテキスト内学習は10–20ショット設定では競争力のある性能を示すが、すぐに飽和し、40ショット設定ではOptiPromptに劣る。
  • 2ホップ関係におけるマニュアルテンプレートのゼロショット性能は非常に低く(14.4%)、文法的複雑さの課題が顕著である。
  • 出力層または隠れ層のバイアスのみを微調整する制御ベースラインは、BitFitより性能が劣るため、知識へのアクセスが単なる出力バイアス化をはるかに超えて向上していることが証明された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。