Skip to main content
QUICK REVIEW

[論文レビュー] Residual Energy-Based Models for Text Generation

Yuntian Deng, Anton Bakhtin|arXiv (Cornell University)|Apr 22, 2020
Topic Modeling参考文献 33被引用数 15
ひとこと要約

この論文では、事前学習済み自己回帰的言語モデルの残差空間における系列のエネルギー関数を学習することで、テキスト生成のための残差エネルギーに基づくモデル(EBM)を提案する。ノイズ対比推定と重要度サンプリングを用いることで、強力な自己回帰的ベースラインよりも低いパープレキシティとより高品質な生成を達成し、人的評価でもその出力が好まれる。

ABSTRACT

Text generation is ubiquitous in many NLP tasks, from summarization, to dialogue and machine translation. The dominant parametric approach is based on locally normalized models which predict one word at a time. While these work remarkably well, they are plagued by exposure bias due to the greedy nature of the generation process. In this work, we investigate un-normalized energy-based models (EBMs) which operate not at the token but at the sequence level. In order to make training tractable, we first work in the residual of a pretrained locally normalized language model and second we train using noise contrastive estimation. Furthermore, since the EBM works at the sequence level, we can leverage pretrained bi-directional contextual representations, such as BERT and RoBERTa. Our experiments on two large language modeling datasets show that residual EBMs yield lower perplexity compared to locally normalized baselines. Moreover, generation via importance sampling is very efficient and of higher quality than the baseline models according to human evaluation.

研究の動機と目的

  • 自己回帰的テキスト生成における露出バイアスと長距離の一貫性の欠如を解消するため、トークンごとの逐次処理ではなく、系列全体を統合的にモデル化すること。
  • 通常は正規化とサンプリングの課題により、自然言語では扱いにくい未正規化エネルギーに基づくモデル(EBM)の、トレーニングの実行可能性と効率的な生成を可能にすること。
  • 事前学習済み自己回帰的モデルの長所とEBMのグローバルな系列スコアリングの長所を、残差定式化によって統合することで、テキスト生成の品質を向上させること。
  • EBMに基づくテキスト生成が、パープレキシティと人的評価の両面で、強力な自己回帰的ベースラインを上回ることを示すこと。

提案手法

  • モデルは残差定式化を用いる:$ P_{\theta}(x) \propto P_{LM}(x) \exp(-E_{\theta}(x)) $、ここで $ P_{LM}(x) $ は固定された事前学習済み自己回帰的言語モデルであり、$ E_{\theta}(x) $ は学習可能なエネルギー関数である。
  • トレーニングには条件付きノイズ対比推定(NCE)を用い、実際のトレーニング系列をポジティブ例、ベース言語モデルからのサンプルをネガティブ例として使用する。
  • 生成は、ベース言語モデルから得た多数の候補系列に対する重要度サンプリングにより実行され、効率的かつ高品質なサンプリングを可能にする。
  • エネルギー関数に双方向コンテキスト表現(例:BERT、RoBERTa)を活用することで、系列レベルのモデリングを向上させる。
  • パープレキシティは、統合モデルを用いて推定され、自己回帰的ベースラインとの直接比較が可能になる。
  • このアプローチは、双方向トランスフォーマー(例:BERT)を、学習可能な残差エネルギー関数を介してテキスト生成に微調整する方法であると解釈できる。

実験結果

リサーチクエスチョン

  • RQ1直接的な最尤推定やMCMCサンプリングが非現実的である状況下でも、エネルギーに基づくモデルを効果的にトレーニングおよびテキスト生成に使用できるか?
  • RQ2事前学習済み言語モデルの残差空間に、系列レベルのエネルギー関数を学習することで、生成品質の向上とパープレキシティの低減が達成できるか?
  • RQ3ベースモデルの多数の生成に対して重要度サンプリングを適用することで、自己回帰的モデルにおけるグリーディーやビームサーチよりも高品質な出力を得られるか?
  • RQ4真のデータ分布との適合度において、統合EBMモデルはベース言語モデルよりも優れているか?

主な発見

  • 残差EBMは、2つの大規模言語モデリングデータセットにおいて、ベースの自己回帰的言語モデルよりも低いパープレキシティを達成した。
  • 実データとモデルサンプルの間の平均対数尤度スコアの差が、ベースモデルの21.64から統合モデルの6.20に減少し、データ分布への適合度が向上したことが示された。
  • 人的評価では、残差EBMの生成物がベースライン言語モデルの生成物よりも顕著に好まれた。
  • トレーニングおよび推論の両方において、高い効率性を維持しており、事前に生成されたネガティブ例と重要度サンプリングに依存している。
  • エネルギー関数は、ベースモデルからの低品質な生成を効果的に低減し、全体的な出力品質を向上させた。
  • EBMに基づくテキスト生成が、自動評価と人的評価の両方の指標で、強力な自己回帰的ベースラインを上回ることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。