Skip to main content
QUICK REVIEW

[論文レビュー] Prototypical Verbalizer for Prompt-based Few-shot Tuning

Ganqu Cui, Shengding Hu|arXiv (Cornell University)|Mar 18, 2022
Topic Modeling被引用数 8
ひとこと要約

本稿では、対照的学習を用いて訓練データからクラスプロトタイプを学習する、プロンプトベースの少样本微調整における自動語彙化器構築のための新規手法であるPrototypical Verbalizer(ProtoVerb)を提案する。ProtoVerbは、特に低データ環境下でも従来の自動語彙化器を著しく上回り、人為的に設計されたラベル語を用いずに、豊富で抽象的なクラスレベルの意味を捉えることで、未微調整の事前学習済み言語モデルの性能向上にも寄与する。

ABSTRACT

Prompt-based tuning for pre-trained language models (PLMs) has shown its effectiveness in few-shot learning. Typically, prompt-based tuning wraps the input text into a cloze question. To make predictions, the model maps the output words to labels via a verbalizer, which is either manually designed or automatically built. However, manual verbalizers heavily depend on domain-specific prior knowledge and human efforts, while finding appropriate label words automatically still remains challenging.In this work, we propose the prototypical verbalizer (ProtoVerb) which is built directly from training data. Specifically, ProtoVerb learns prototype vectors as verbalizers by contrastive learning. In this way, the prototypes summarize training instances and are able to enclose rich class-level semantics. We conduct experiments on both topic classification and entity typing tasks, and the results demonstrate that ProtoVerb significantly outperforms current automatic verbalizers, especially when training data is extremely scarce. More surprisingly, ProtoVerb consistently boosts prompt-based tuning even on untuned PLMs, indicating an elegant non-tuning way to utilize PLMs. Our codes are avaliable at https://github.com/thunlp/OpenPrompt.

研究の動機と目的

  • 手動語彙化器の限界、特にリソースが限られた環境下で必要な分野特有の知識と人的努力を解消すること。
  • 低データ環境下での性能が不十分な自動語彙化器構築の課題を克服し、訓練インスタンスから代表的なクラスレベルの意味を学習すること。
  • 事前学習済み言語モデルの微調整を必要とせず、即挿入可能で、非微調整の手法として、プロンプトベースの微調整を向上させること。
  • 少数の例から学習したプロトタイプが、抽象的で人間らしいクラス概念を捉え、未観測データに一般化できるかどうかを調査すること。

提案手法

  • ProtoVerbは、インスタンスとプロトタイプの対照的学習を、InfoNCE損失関数を用いて行い、インスタンスをクラス中心に近づけることで、各クラスの連続的プロトタイプベクトルを学習する。
  • 本手法は2つの損失成分を用いる:インスタンス同士の対照的損失により、クラス内インスタンスをクラスタリングし、クラス間インスタンスを分離し、インスタンス-プロトタイプ損失により、プロトタイプを中心的表現として強制する。
  • プロトタイプは、事前学習済み言語モデルの隠れ表現を用いて、エンドツーエンドで最適化され、限られた訓練データから豊かなクラスレベルの意味を要約できる。
  • 学習されたプロトタイプは、モデルの予測(例:[MASK]トークン)を、プロトタイプベクトルとのコサイン類似度を用いてクラスラベルにマッピングすることで、語彙化器として機能する。
  • プロトタイプの解釈のため、埋め込み空間の整合性を用いて語彙から類似度が最も高い語を検索し、プロトタイプの意味的性質を分析可能にする。
  • 本手法は、手動語彙化器や未微調整の事前学習済みモデルと両立可能であり、即挿入可能で、広範な適用性を有するように設計されている。

実験結果

リサーチクエスチョン

  • RQ1少数の訓練インスタンスから学習したプロトタイプは、少样本学習におけるクラスレベルの意味を効果的に表現できるか?
  • RQ2低データ条件下での性能と頑健性の観点から、手動語彙化器、探索ベース語彙化器、ソフト語彙化器と比較して、ProtoVerbはどのように差をつけるか?
  • RQ3ProtoVerbは、単なる実体レベルの名前ではなく、抽象的概念をどれだけ効果的に捉え、未観測データに一般化できるか?
  • RQ4未微調整の事前学習済み言語モデルを用いても、ProtoVerbは性能向上をもたらすか?
  • RQ5プロトタイプの意味的整合性は、人為的に設計された語彙化器とどの程度類似しているか?

主な発見

  • ProtoVerbは、トピック分類およびエンティティタイプ分類の両タスクにおいて、最先端の自動語彙化器を著しく上回り、特に訓練データが限られる状況で顕著な優位性を示す。
  • AG’s Newsでは1ショット(1例)での精度が78.4%に達し、次善のベースラインを5ポイント以上上回る。
  • 手動語彙化器と組み合わせて使用した場合、追加コストを最小限に抑えながら一貫して性能向上を示し、補完的向上要因としての役割を実証した。
  • Labelノイズに対して頑健である:1〜3件の誤標籤付きでも、ベースライン手法と比較して性能低下が著しく小さい。
  • 1つの訓練例のみでも、意味的プロトタイプが生成可能である(例:『スポーツ』クラスでは『Dodgers』や『Knicks』を特定)—これは、顕著な意味的特徴を抽出できる能力を示している。
  • ショットサイズが増加するにつれて、プロトタイプと手動語彙化器との類似度が上昇し、平均で0.25以上の正規化類似度に達する。特に『スポーツ』および『ビジネス』分野で最高値を示し、概念的特徴の効果的な抽象化が達成されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。