Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Few-Shot Learning Without Prompts

Lewis Tunstall, Nils Reimers|arXiv (Cornell University)|Sep 22, 2022
Topic Modeling被引用数 98
ひとこと要約

SetFitはプロンプト不要のSiamese-styleファインチューニングフレームワークで、sentence transformersを対象とし、プロンプトベースの手法よりはるかに小さなモデルと高速な学習/推論で強力なfew-shotテキスト分類を実現します。

ABSTRACT

Recent few-shot methods, such as parameter-efficient fine-tuning (PEFT) and pattern exploiting training (PET), have achieved impressive results in label-scarce settings. However, they are difficult to employ since they are subject to high variability from manually crafted prompts, and typically require billion-parameter language models to achieve high accuracy. To address these shortcomings, we propose SetFit (Sentence Transformer Fine-tuning), an efficient and prompt-free framework for few-shot fine-tuning of Sentence Transformers (ST). SetFit works by first fine-tuning a pretrained ST on a small number of text pairs, in a contrastive Siamese manner. The resulting model is then used to generate rich text embeddings, which are used to train a classification head. This simple framework requires no prompts or verbalizers, and achieves high accuracy with orders of magnitude less parameters than existing techniques. Our experiments show that SetFit obtains comparable results with PEFT and PET techniques, while being an order of magnitude faster to train. We also show that SetFit can be applied in multilingual settings by simply switching the ST body. Our code is available at https://github.com/huggingface/setfit and our datasets at https://huggingface.co/setfit .

研究の動機と目的

  • プロンプトベースおよび大規模モデルを用いたfew-shot法の制約(プロンプト設計、計算コストの高さ、不安定性)に対処する。
  • SetFitを、few-shot設定におけるプロンプトフリーの2段階ファインチューニングフレームワークとして提案する。
  • 多様なデータセットと言語、蒸留シナリオにわたるSetFitの性能を実証する。
  • 精度と効率の観点から、SetFitを最先端のPET/PEFTベース手法およびプロンプトベースアプローチと比較する。
  • 実用的なfew-shotタスクへの適用を促進するため、公開可能なコードとデータを提供する。

提案手法

  • 小規模なラベル付きデータセット上で、対比的Siamese目的を用いて事前学習済みのSentence Transformer(ST)をファインチューニングし、豊富な埋め込みを生成する。
  • クラス間の正例/負例の文のトリプレットを用いて、対比的ファインチューニングのための拡張データを生成する(各クラスあたりRの正例、Rの負例)。
  • ファインチューニング済みSTを用いてラベル付き例をエンコードして埋め込みを作成し、これらの埋め込み上にロジスティック回帰分類ヘッドを訓練する。
  • 新しい入力をSTでエンコードし、訓練済みヘッドで予測して推論を行う。
  • STファインチューニングにはコサイン類似度損失を用い、学習率1e-3、バッチサイズ16、最大長さ256トークン、1エポックで行う。

実験結果

リサーチクエスチョン

  • RQ1プロンプトフリーでsentence-transformerベースのアプローチは、PET/PEFTおよびプロンプトベースの手法と比較して、few-shot学習において競争力のある精度を達成できるだろうか?
  • RQ2限られたラベルデータで、SetFitは多言語データやさまざまなテキスト分類タスクでどう性能を発揮するのか。
  • RQ3大規模なプロンプトベース手法と比較した場合のSetFitの学習/推論の効率性の利点は何か?
  • RQ4リソース制約下のハードウェア条件でのfew-shot蒸留においてSetFitは有効か?

主な発見

  • SetFit MPNetは強力なfew-shot性能を達成し、N=8でFineTuneを平均19.3ポイント上回り、N=64でギャップを縮める。
  • SetFit MPNetは小さなNでPerfectおよびAdapetを上回り、T-Few 3Bと競合する一方でプロンプトフリーかつはるかに小型。
  • RAFTではSetFit RoBERTaがGPT-3およびPETを上回り、いくつかのタスクで人間のベースラインを上回る一方、T-Few 11Bには及ばない。
  • 多言語MARC実験では、多言語ST埋め込みを用いたSetFitは、8-shot設定で言語を超えて常にFineTuneおよびAdapetを上回る。
  • 蒸留実験は、SetFit teacher-student構成において、非常に小さなNで未ラベルデータが限られていても、より小さなSetFitの学生が基準学生と同等かそれを上回ることを示している。
  • SetFitはT-Few 3Bより訓練/推論が一桁速く、ストレージ容量もはるかに小さく、実運用展開上の利点が大きい。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。