Skip to main content
QUICK REVIEW

[論文レビュー] PERFECT: Prompt-free and Efficient Few-shot Learning with Language Models

Rabeeh Karimi Mahabadi, Luke Zettlemoyer|arXiv (Cornell University)|Apr 3, 2022
Topic Modeling被引用数 8
ひとこと要約

この論文では、手動で設計されたプロンプトや語彙化器を不要にする、プロンプトフリーで効率的なfew-shot学習手法Perfectを提案する。タスク固有のアダプタと学習可能なマルチトークンラベル埋め込みを用いることで、32例のデータのみで12のNLPベンチマークで最先端の性能を達成し、従来の手法と比較して学習時間を最大100倍短縮し、ストレージコストを100倍削減する。

ABSTRACT

Current methods for few-shot fine-tuning of pretrained masked language models (PLMs) require carefully engineered prompts and verbalizers for each new task to convert examples into a cloze-format that the PLM can score. In this work, we propose PERFECT, a simple and efficient method for few-shot fine-tuning of PLMs without relying on any such handcrafting, which is highly effective given as few as 32 data points. PERFECT makes two key design choices: First, we show that manually engineered task prompts can be replaced with task-specific adapters that enable sample-efficient fine-tuning and reduce memory and storage costs by roughly factors of 5 and 100, respectively. Second, instead of using handcrafted verbalizers, we learn new multi-token label embeddings during fine-tuning, which are not tied to the model vocabulary and which allow us to avoid complex auto-regressive decoding. These embeddings are not only learnable from limited data but also enable nearly 100x faster training and inference. Experiments on a wide range of few-shot NLP tasks demonstrate that PERFECT, while being simple and efficient, also outperforms existing state-of-the-art few-shot learning methods. Our code is publicly available at https://github.com/facebookresearch/perfect.git.

研究の動機と目的

  • 事前学習済み言語モデル(PLM)のfew-shot微調整において、手動によるプロンプトおよび語彙化器の設計を不要にする。
  • 32例のデータという極めて少ない例数の環境でも、サンプル効率と学習の安定性を向上させる。
  • プロンプトベースの微調整手法と比較して、メモリ、ストレージ、推論コストを低減する。
  • 既存のプロンプトベースおよびアダプタベースのfew-shot学習アプローチを凌駆するシンプルで汎用性の高いフレームワークを開発する。
  • タスク固有のプロンプトや語彙化なしに、効果的なfew-shot学習が達成可能であることを示す。

提案手法

  • Transformerアーキテクチャに埋め込まれたタスク固有のアダプタレイヤーによって、手動で設計されたプロンプトを置き換え、主なPLM重みは固定し、微調整対象はアダプタのみとする。
  • モデルの語彙とは無関係に、固定長のマルチトークンラベル埋め込みを各クラスに対して学習可能なものとして導入し、微調整中にエンドツーエンドで学習する。
  • 自己回帰的デコードを必要とせず、複数トークンのプロトタイプネットワークを用いてログチを計算することで、高速な推論を実現する。
  • 動的マスクトークン挿入を伴うマスク言語モデルの目的関数を採用し、各タスクに応じてマスク数を最適化して性能を最大化する。
  • 低ショット環境における一般化性能の向上を図るため、ラベル埋め込み上にコントラスト学習の目的関数を適用する。
  • ハイパーパramータのチューニングに、16例の小規模な検証セットを用いることで、few-shot学習設定に整合性を保つ。

実験結果

リサーチクエスチョン

  • RQ1PLMを用いたfew-shot学習は、手動で設計されたプロンプトや語彙化器なしで達成可能か?
  • RQ2タスク固有のアダプタは、メモリおよびストレージコストを削減しつつ、サンプル効率の高い微調整を可能にするか?
  • RQ3学習可能なマルチトークンラベル埋め込みは、低ショット環境で手動で設計された語彙化器を上回る性能を発揮するか?
  • RQ4ラベル予測に自己回帰的デコードを排除することで、性能に損なわれることなく顕著な高速化が達成できるか?
  • RQ5プロンプトフリーでアダプタベースの手法は、多様なfew-shot NLPベンチマークで最先端の性能を達成できるか?

主な発見

  • Perfectは12の多様なNLPベンチマークで最先端の性能を達成し、既存のプロンプトベース手法を上回る。
  • SST-2データセットでは、32例の学習で90.7%のテスト精度を達成し、アダプタなしのベースラインより2.5ポイント高い。
  • Perfectを用いた学習は、自己回帰的デコードを要する手法と比較して最大100倍高速であり、ストレージコストは100倍低減される。
  • 異なるfew-shot学習セットにおける性能のばらつきが低減され、最悪ケースの精度が向上しており、より高い安定性を示している。
  • アダプタの使用により、トレーニング可能なパラメータ数が顕著に削減され、少ないデータ環境でもより高いサンプル効率と収束性が実現された。
  • 最適なマスクトークン数はタスクによって異なるが、大多数のタスクで2つのマスクが最良の性能を発揮した。一部のタスク(例:MRPC)では、より多くのマスクが効果を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。