Skip to main content
QUICK REVIEW

[論文レビュー] DExperts: Decoding-Time Controlled Text Generation with Experts and Anti-Experts

Alisa Liu, Maarten Sap|arXiv (Cornell University)|May 7, 2021
Topic Modeling参考文献 41被引用数 11
ひとこと要約

DExpertsは、事前学習された言語モデルの出力をプロダクト・オブ・エキスパートとアンチエキスパート——望ましいおよび望ましくないテキスト属性で微調整された小さな言語モデル——を用いて再重み付けすることで、推論時における制御されたテキスト生成を実現する手法を提案する。この手法は、トキシシティ除去やセンチメント制御において、微少なデータやGPT-3のような大規模モデルをAPI経由で利用する場合でも、熟練性と一般化性能を保ちながら、既存の手法を上回る性能を発揮する。

ABSTRACT

Despite recent advances in natural language generation, it remains challenging to control attributes of generated text. We propose DExperts: Decoding-time Experts, a decoding-time method for controlled text generation that combines a pretrained language model with "expert" LMs and/or "anti-expert" LMs in a product of experts. Intuitively, under the ensemble, tokens only get high probability if they are considered likely by the experts, and unlikely by the anti-experts. We apply DExperts to language detoxification and sentiment-controlled generation, where we outperform existing controllable generation methods on both automatic and human evaluations. Moreover, because DExperts operates only on the output of the pretrained LM, it is effective with (anti-)experts of smaller size, including when operating on GPT-3. Our work highlights the promise of tuning small LMs on text with (un)desirable attributes for efficient decoding-time steering.

研究の動機と目的

  • ベース言語モデルの重みを再学習・微調整することなく、生成テキストに不適切な属性(例:トキシシティや否定的センチメント)を制御する課題に対処すること。
  • 大規模な事前学習済み言語モデル(例:GPT-3)を推論時に効率的に制御できる、軽量で効率的な手法を開発すること。
  • 特定の属性分布に特化した小さな専用言語モデル(エキスパートおよびアンチエキスパート)のみを用いて、効果的な制御を可能にすること。
  • エキスパートおよびアンチエキスパートモデルの出力の直接的な確率アンサンブルが、クラス確率を推定する手法(例:GeDi や FUDGE)よりも効果的であることを示すこと。
  • 非トキシックな例のアノテーションが不要な状況でも、アンチエキスパートのみを用いることで効果的な制御が可能であることを示すこと。

提案手法

  • DExpertsは、ベース事前学習済み言語モデルに、望ましい属性をモデル化するエキスパートLMと、望ましくない属性をモデル化するアンチエキスパートLMを、プロダクト・オブ・エキスパートの定式化により統合する。
  • 各デコードステップで、ベースモデルのロジットは、エキスパートとアンチエキスパートのロジットの差分を用いて再重み付けされる:$\tilde{\mathbf{z}}_t = \mathbf{z}_t + \alpha(\mathbf{z}^{+}_t - \mathbf{z}^{-}_t)$、ここで$\alpha$はステアリング強度を制御する。
  • 再重み付けされたロジットに対してソフトマックスを適用することで、最終的なトークン分布が得られ、熟練性と多様性を保ちつつ制御された生成が可能になる。
  • この手法は、ベースモデルの出力のみに依存するため、GPT-3のようなブラックボックスモデル(API経由でアクセス可能)とも互換性がある。
  • エキスパートおよびアンチエキスパートは、小規模な人間アノテートデータセット(例:650件のトキシックコメント)を用いて微調整され、特定の属性をモデル化する。
  • このアプローチは属性に一般化可能であり、トキシシティとセンチメント制御の両方に対して適用可能で、強靭性と有効性を示している。

実験結果

リサーチクエスチョン

  • RQ1エキスパートおよびアンチエキスパート言語モデルに基づく推論時手法が、ベースモデルの重みにアクセスできない状況でも、生成テキストのトキシシティを効果的に低減できるか。
  • RQ2DExpertsは、自動評価および人的評価の両面で、トキシシティ除去の分野において、既存の制御生成手法と比較してどの程度優れているか。
  • RQ3非トキシックなトレーニング例が不要な状況でも、アンチエキスパートのみを用い、ベースモデルをエキスパートとして再利用することで、DExpertsが効果的な制御を達成できるか。
  • RQ4特に、逆のセンチメントを引き出すように設計されたプロンプトに対して、DExpertsはセンチメント制御においてどの程度効果的か。
  • RQ5微調整された小さなエキスパートおよびアンチエキスパートモデルが、軽量で推論時に行われる方法として、大規模で固定されたベースモデルを効果的にステアリングできる程度はどの程度か。

主な発見

  • DExpertsは、自動評価および人的評価の両方において、言語のトキシシティ除去の分野で既存手法を上回り、トキシシティを低減するとともに、高い熟練性と多様性を維持している。
  • アンチエキスパートのトレーニングに650件のトキシックコメントしか使用しなくても、データ効率性が高いことが示された。
  • 非トキシックな例のアノテーションが不要な状況でも、アンチエキスパートのみを用い、ベースモデルをエキスパートとして再利用することで、DExpertsは効果的である。
  • センチメント制御においても、DExpertsは自動評価および人的評価の両方でベースラインを上回っており、特に逆のセンチメントを引き出すように設計されたプロンプト(敵対的設定)において顕著な優位性を示している。
  • この手法は異なる属性に一般化可能であり、GPT-3をAPI経由で適用した場合でも、強力な性能を維持しており、大規模なブラックボックスモデルとの互換性を示している。
  • エキスパートおよびアンチエキスパートの出力の直接的な確率アンサンブルは、クラス確率を推定する手法(例:GeDi や FUDGE)よりも効果的であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。