Skip to main content
QUICK REVIEW

[論文レビュー] RLPrompt: Optimizing Discrete Text Prompts with Reinforcement Learning

Mingkai Deng, Jianyu Wang|arXiv (Cornell University)|May 25, 2022
Topic Modeling被引用数 13
ひとこと要約

RLPromptは、固定された大規模言語モデル向けに、勾配フリーで転送可能かつ解釈可能なプロンプトチューニングを実現する強化学習ベースの手法を提案する。この手法は、政策ネットワークを用いて効果的なプロンプトを生成するが、しばしば文法的に不正確で意味のないごみくずのような形を取るが、モデルやタスクをまたいで一般化する。少データ(few-shot)およびゼロデータ(zero-shot)設定において、従来のプロンプト手法やファインチューニングを上回る性能を発揮する。

ABSTRACT

Prompting has shown impressive success in enabling large pretrained language models (LMs) to perform diverse NLP tasks, especially when only few downstream data are available. Automatically finding the optimal prompt for each task, however, is challenging. Most existing work resorts to tuning soft prompt (e.g., embeddings) which falls short of interpretability, reusability across LMs, and applicability when gradients are not accessible. Discrete prompt, on the other hand, is difficult to optimize, and is often created by "enumeration (e.g., paraphrasing)-then-selection" heuristics that do not explore the prompt space systematically. This paper proposes RLPrompt, an efficient discrete prompt optimization approach with reinforcement learning (RL). RLPrompt formulates a parameter-efficient policy network that generates the desired discrete prompt after training with reward. To overcome the complexity and stochasticity of reward signals by the large LM environment, we incorporate effective reward stabilization that substantially enhances the training efficiency. RLPrompt is flexibly applicable to different types of LMs, such as masked (e.g., BERT) and left-to-right models (e.g., GPTs), for both classification and generation tasks. Experiments on few-shot classification and unsupervised text style transfer show superior performance over a wide range of existing finetuning or prompting methods. Interestingly, the resulting optimized prompts are often ungrammatical gibberish text; and surprisingly, those gibberish prompts are transferrable between different LMs to retain significant performance, indicating LM prompting may not follow human language patterns.

研究の動機と目的

  • 大規模言語モデルからの勾配に依存せずに、離散的テキストプロンプトを効率的に最適化する課題に対処すること。
  • 異なる言語モデル間で解釈可能で再利用可能かつ転送可能なプロンプトを生成する手法を開発すること。
  • 報酬ベースの強化学習を用いて、ラベル付きデータが存在しない(ゼロショット)状況でも効果的なプロンプト最適化を可能にすること。
  • ソフトプロンプトチューニング、手動プロンプト、ヒューリスティックな列挙の制限を克服し、学習可能でポリシーに基づく離散的プロンプト生成器を導入すること。
  • 言語的に整合性のない「ごみくず」なプロンプトでも、高い性能を発揮し、異なるモデル間で転送可能であることを示すこと。

提案手法

  • RLPromptは、政策ネットワークが離散的プロンプトトークンを生成する強化学習問題として離散的プロンプト最適化を定式化する。
  • 報酬は、下流タスクにおける言語モデルの出力から導出される。この報酬は、既存の強化学習アルゴリズムを用いて政策ネットワークを訓練する。
  • ブラックボックスの言語モデル環境からの複雑で確率的な報酬信号に対処するため、報酬安定化機構を導入する。
  • この手法は、distilGPT-2のような固定されたコンact言語モデルに組み込まれる、小さなパラメータ効率の良い政策ネットワーク(例:MLP)を用いる。
  • 分類および生成タスクの両方で、マスクされたLM(例:BERT)および自己回帰的LM(例:GPT)の両方をサポートする。
  • ラベル付きデータが存在しない場合に弱い信号に基づいて報酬関数を定義することで、ゼロショットプロンプティングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1強化学習は、言語モデルからの勾配を必要とせずに、離散的テキストプロンプトを効果的に最適化できるか?
  • RQ2最適化された離散的プロンプトは、文法的に不正確または意味のないものであっても、異なる言語モデル間で一般化するか?
  • RQ3報酬ベースの強化学習を用いた離散的プロンプト最適化は、少データおよびゼロショット学習設定で、従来の手法を上回る性能を発揮するか?
  • RQ4報酬安定化は、強化学習ベースのプロンプト最適化における学習効率と収束性にどのような影響を与えるか?
  • RQ5言語的に整合性のないプロンプトが、なぜ下流タスクで高い性能を発揮するのか?

主な発見

  • RLPromptは、少データテキスト分類タスクで最先端の性能を達成し、手動プロンプト、ソフトプロンプトチューニング、AutoPromptを上回る。
  • 無教師テキストスタイル転送において、RLPromptはすべてのベースラインを上回り、特にシェイクスピア風スタイル転送で28.3%のGMスコアを達成した。
  • 最適化されたプロンプトはしばしば文法的に不正確なごみくず(例:'Fixed ( $-$ contrasts ( $-$ contrasts Dutch English excellent Correct )')であるが、依然として非常に効果的である。
  • これらの意味のないプロンプトは強力な転送性を示す:GPT-2 や BERT といった異なる言語モデルに対しても、顕著な性能を維持する。
  • 弱い教師信号と報酬形状の工夫を活用することで、ラベル付きデータが存在しない状況でも、高いゼロショット性能を達成する。
  • 報酬安定化は学習効率と収束性を著しく向上させ、複雑で高次元のプロンプト空間における安定した強化学習訓練を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。