Skip to main content
QUICK REVIEW

[論文レビュー] PromptBoosting: Black-Box Text Classification with Ten Forward Passes

Bairu Hou, Joe O’Connor|arXiv (Cornell University)|Dec 19, 2022
Natural Language Processing Techniques被引用数 11
ひとこと要約

PromptBoostingは、プロンプト最適化を回避するため、少数のプロンプトと言語モデルの出力分布から弱学習器のアンサンブルを構築することで、プロンプト効率的でブラックボックスなテキスト分類手法である。バッチあたり10回のフォワードパスでのみ実行され、少数 shot および標準設定で最先端の性能を達成しており、既存のブラックボックス手法を上回り、ファインチューニングと同等の性能を発揮しながらも10倍速い。

ABSTRACT

We describe PromptBoosting, a query-efficient procedure for building a text classifier from a neural language model (LM) without access to the LM's parameters, gradients, or hidden representations. This form of "black-box" classifier training has become increasingly important as the cost of training and inference in large-scale LMs grows. But existing black-box LM classifier learning approaches are themselves computationally inefficient, typically specializing LMs to the target task by searching in a large space of (discrete or continuous) prompts using zeroth-order optimization methods. Instead of directly optimizing in prompt space, PromptBoosting obtains a small pool of prompts via a gradient-free approach and then constructs a large pool of weak learners by pairing these prompts with different elements of the LM's output distribution. These weak learners are then ensembled using the AdaBoost algorithm. The entire learning process requires only a small number of forward passes and no backward pass. Experiments show that PromptBoosting achieves state-of-the-art performance in multiple black-box few-shot classification tasks, and matches or outperforms full fine-tuning in both few-shot and standard learning paradigms, while training 10x faster than existing black-box methods.

研究の動機と目的

  • パrameter、勾配、隠れ状態がアクセスできない大規模言語モデル(LM)におけるブラックボックスプロンプトチューニングの高い計算コストを軽減すること。
  • 勾配ベースの最適化に依存せずに、効果的なプロンプトベース分類に必要なLMクエリ数を削減すること。
  • ブラックボックス設定において、高いパフォーマンスを維持しながら推論効率を著しく向上させる手法を開発すること。
  • モデルの出力分布(語彙変換子)を用いたアンサンブル学習によって、プロンプトの質を補完できることを示すこと。
  • 特にクラウドベースのLMサービスにおいてモデル内部にアクセスできない状況でも、LMの効率的適応を可能にすること。

提案手法

  • PromptBoostingは、勾配フリーな手法を用いて、最適でない少数のプロンプトプールをまず生成し、高価なプロンプト最適化を回避する。
  • 次に、各プロンプトを言語モデルの出力分布(語彙変換子)の異なる要素(例:クラス固有のトークン)とペアにすることで、多数の弱学習器を生成する。
  • これらの弱学習器は、AdaBoostアルゴリズムを用いてアンサンブル化され、最適化は各イテレーションで語彙変換子に対してのみ行われる。プロンプト自体は最適化されない。
  • このプロセス全体は、言語モデルを前方伝搬するのみで、逆伝搬や勾配計算は一切不要である。
  • この手法は、言語モデルの出力分布に内在する多様性を活用し、プロンプトをチューニングせずに強力なアンサンブル予測を生成する。
  • フレームワークはクエリ効率的であり、バッチあたりわずか10回のフォワードパスで実行可能で、少数 shot およびフルデータ学習の両方と互換性がある。

実験結果

リサーチクエスチョン

  • RQ1最小限のLMクエリ数で高い精度を維持しつつ、ブラックボックステキスト分類器を構築できるか?
  • RQ2固定されたプロンプトプールとLMの出力分布から導出される弱学習器のアンサンブルは、ブラックボックス設定でプロンプト最適化を上回る性能を発揮するか?
  • RQ3モデルパラメータや勾配にアクセスできない状況でも、完全なファインチューニングと同等のパフォーマンスを達成できる手法は存在するか?
  • RQ4プロンプト数がアンサンブルのパフォーマンスと効率に与える影響は何か?
  • RQ5プロンプトがタスクに最適化されていないにもかかわらず、初期プロンプトプールの品質に頼らずに、この手法は頑健か?

主な発見

  • PromptBoostingは、GLUEやHugging Face NLIタスクを含む多数の少数 shot テキスト分類ベンチマークで最先端のパフォーマンスを達成した。
  • QNLIデータセットでは、1つのプロンプトで41.3%の精度にとどまるのに対し、10個のプロンプトを用いたPromptBoostingでは84.6%の精度にまで向上した。
  • 少数 shot およびフルデータ学習の両設定において、PromptBoostingは完全なファインチューニングのパフォーマンスを達成または上回った。
  • PromptBoostingは、既存のブラックボックスプロンプト学習手法よりも10倍速く、バッチあたりわずか10回のフォワードパスで実行された。
  • LM-BFF、PET、手動プロンプトなど、異なるプロンプト生成手法に対しても性能が安定しており、アンサンブル機構の頑健性を確認した。
  • プロンプト数を10個から20個に増やしてもパフォーマンス向上はわずかであり、10個のプロンプトで十分に最適なパフォーマンスが達成されることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。