Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Multi-Label Prompting: Simple and Interpretable Few-Shot Classification

Han Wang, Canwen Xu|arXiv (Cornell University)|Apr 13, 2022
Topic Modeling被引用数 6
ひとこと要約

本稿では、1対多のラベルマッピングを活用して、人為的ラベルエンジニアリングなしで、パラメータフリーかつ統計ベースの手法であるAutomatic Multi-Label Prompting (AMuLaP) を提案する。AMuLaPは、少数ショットテキスト分類のための複数のラベル語を自動的に選択する。モデルの重みにアクセスできない状況や人為的ラベル付けが不要な状況下でも、GLUEベンチマークで競争力のある性能を達成しており、1クラスあたり1〜2例の訓練例しか利用できない状況ですら、標準的な微調整を上回る性能を発揮する。

ABSTRACT

Prompt-based learning (i.e., prompting) is an emerging paradigm for exploiting knowledge learned by a pretrained language model. In this paper, we propose Automatic Multi-Label Prompting (AMuLaP), a simple yet effective method to automatically select label mappings for few-shot text classification with prompting. Our method exploits one-to-many label mappings and a statistics-based algorithm to select label mappings given a prompt template. Our experiments demonstrate that AMuLaP achieves competitive performance on the GLUE benchmark without human effort or external resources.

研究の動機と目的

  • 少数ショットプロンプティングにおける人為的ラベルエンジニアリングを排除し、ラベル語の選択を自動化すること。
  • ノイズ低減と有効な監視の拡張を実現する1対多のラベルマッピングを用いて、少数ショット分類の性能を向上させること。
  • モデルの重みや外部の事前学習にアクセスできない状況でも動作する手法を開発し、GPT-3のようなブラックボックス言語モデルへの応用を可能にすること。
  • 多様な少数ショット設定およびモデル構成において、ラベル選択の有効性を評価すること。
  • 自動プロンプトベース学習におけるラベルセットサイズ、品質、性能のトレードオフを分析すること。

提案手法

  • AMuLaPは、少数ショット訓練セットにおける入力トークンの分布と最も整合性の高いラベル語を特定する統計ベースのアルゴリズムを用いる。
  • 各クラスに対して複数の候補ラベル語を関連付ける1対多のラベルマッピングを活用し、ノイズを低減し一般化性能を向上させる。
  • モデルの微調整や勾配更新に依存せず、少数ショット例における統計的共起パターンにのみ依存して動作する。
  • プロンプトテンプレートが固定された後、そのテンプレートに最適なラベル語選択を最適化することに焦点を当てる。
  • アルゴリズムは、少数ショット例内の入力トークンに対する統計的関連性を測定し、単純だが効果的なスコアリング機構を用いてラベル語を選択する。
  • AMuLaPは、バックボーンモデルの重みにアクセスする必要がなく、GPT-3のようなブラックボックス言語モデルとも連携可能である。

実験結果

リサーチクエスチョン

  • RQ1人為的介入なしで、パラメータフリーの純粋な統計的手法が、少数ショットプロンプティングに適したラベル語を自動的に選択できるか?
  • RQ21クラスあたり複数のラベル語を使用することにより、単一ラベルマッピングと比較して、少数ショット分類性能にどのような影響を与えるか?
  • RQ31クラスあたり1〜2例の訓練例しか利用できない状況で、AMuLaPによる自動ラベル選択が標準的な微調整を上回るか?
  • RQ4ラベルセットサイズ(k)が性能に与える影響は何か?AMuLaPにおける最適なkは存在するか?
  • RQ5モデルの重みや外部微調整にアクセスを要するプロンプティング手法と比較して、AMuLaPはどのように異なるか?

主な発見

  • AMuLaPは、人為的ラベル付けやモデルの重みにアクセスしない状況下でも、GLUEベンチマークで競争力のある性能を達成する。
  • 1クラスあたり1〜2例の訓練例しか利用できない状況では、AMuLaPは標準的な微調整を著しく上回り、微調整はランダムベースラインに近い性能にとどまる。
  • 微調整を併用したAMuLaPは、訓練セットサイズが増加するにつれて性能が向上し、MNLIでは標準的な微調整を上回り、MRPCでは強い性能を維持する。
  • ノイズの多いラベル候補(例:</s>トークン)に対しても、個々の誤りを相殺する複数のラベルの使用により、AMuLaPは頑健である。
  • ランダムマッピングでは、ラベル語の数(k)を増やすことで性能が向上し、ラベルセットサイズが監視の強化に寄与することが示唆されるが、AMuLaPではラベル品質の低下に伴い、あるk値を超えると性能が頭打ちになる。
  • 微調整なしのAMuLaPでは、性能が速やかに飽和する。これは、自動ラベル付けを伴うコンテキスト内学習がコンテキスト長の制限により拡張できず、より多くの例が追加されても性能が向上しないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。