Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Deep Latent Variable Models for Text Generation

Le Fang, Chunyuan Li|arXiv (Cornell University)|Aug 30, 2019
Topic Modeling参考文献 38被引用数 5
ひとこと要約

本稿では、テキスト生成における表現能力の向上と後方分布崩壊の緩和を目的として、ガウス型の変分後方分布をサンプルベースの表現に置き換える暗黙的深層潜在変数モデル(iVAEおよびiVAE-MI)を提案する。平均化された後方分布を相互情報量最大化により事前分布に一致させ、共役双対KL発散度を用いることで、言語モデリング、スタイル変換、対話応答生成の各分野で最先端の性能を達成している。

ABSTRACT

Deep latent variable models (LVM) such as variational auto-encoder (VAE) have recently played an important role in text generation. One key factor is the exploitation of smooth latent structures to guide the generation. However, the representation power of VAEs is limited due to two reasons: (1) the Gaussian assumption is often made on the variational posteriors; and meanwhile (2) a notorious "posterior collapse" issue occurs. In this paper, we advocate sample-based representations of variational distributions for natural language, leading to implicit latent features, which can provide flexible representation power compared with Gaussian-based posteriors. We further develop an LVM to directly match the aggregated posterior to the prior. It can be viewed as a natural extension of VAEs with a regularization of maximizing mutual information, mitigating the "posterior collapse" issue. We demonstrate the effectiveness and versatility of our models in various text generation scenarios, including language modeling, unaligned style transfer, and dialog response generation. The source code to reproduce our experimental results is available on GitHub.

研究の動機と目的

  • 変分オートエンコーダー(VAEs)がテキスト生成において直面する制限、特に変分後方分布に対する固定されたガウス分布の仮定の問題を解決すること。
  • 変分後方分布の最適でない近似によりデコーダーが潜在コードを無視するという、VAEsにおける後方分布崩壊問題を軽減すること。
  • パrametricなガウス族ではなく、暗黙的かつサンプルベースの分布を用いた柔軟な潜在表現フレームワークの構築。
  • 潜在特徴が協調し、意味のある文レベルの情報を捉えるようにすることで、生成品質と多様性を向上させること。
  • 潜在コードとデータ間の相互情報量を最大化する新たな学習目的を定式化し、表現学習を強化すること。

提案手法

  • 潜在空間における標準的なガウス型変分後方分布を、モデルの柔軟性を高めるために、暗黙的かつサンプルベースの表現に置き換える。
  • iVAE-MIを提案し、すべてのデータにおける平均化された後方分布を、双対形式のKL発散度を用いて事前分布に直接一致させる。
  • 共役双対形式のKL発散度を用いることで、明示的な密度評価を必要とせず、補助双対関数を用いた最適化が可能になる。
  • 文脈に依存する事前分布と条件付きモデリングを、文脈埋め込みから事前サンプルへのマッピングを学習することで対話生成に統合する。
  • 潜在コードが情報量が多くかつ多様になるように促進する微分可能な目的関数を用い、相互情報量最大化により学習を実施する。
  • エンコーダー、デコーダー、および文脈エンコーダーにGRUを適用することで、対話およびテキスト生成タスクにおける逐次モデリングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1固定されたガウス分布と比較して、サンプルベースの潜在表現は、テキスト生成における変分後方分布の表現力の向上に寄与するか?
  • RQ2暗黙的潜在変数モデルは、自己回帰的VAEsにおける後方分布崩壊問題をどの程度軽減できるか?
  • RQ3相互情報量最大化により平均化された後方分布を事前分布に一致させることで、より分離可能で意味のある潜在表現が得られるか?
  • RQ4暗黙的LVMは、言語モデリング、スタイル変換、対話応答生成といった多様なテキスト生成タスクでどの程度の性能を発揮するか?
  • RQ5提案手法は、訓練安定性と生成多様性を維持したまま、最先端の結果を達成できるか?

主な発見

  • iVAE-MIモデルは、すべての評価タスクにおいてベースラインVAEやCVAE、SeqGANといった強力なベースラインを上回る一貫した改善を達成している。
  • 対話応答生成のタスクでは、iVAE-MIがBOW埋め込みスコアとDistinct-1/2指標を顕著に向上させ、意味的関連性と多様性の向上を示している。
  • SwitchboardおよびDailyDialogデータセットでは、iVAE-MIがより高いBLEU-4スコアと優れたリCALLを達成しており、基準応答とのn-gramオーバーラップが向上していることが示された。
  • スタイル変換タスクにおいても、iVAE-MIは内容をよりよく保持しており、ARAEと比較して元の意味をより効果的に保っている。
  • 共役双対KL形式により、明示的な密度評価を必要とせず、実用的に暗黙の後方分布を訓練可能にした。
  • 実験的結果から、暗黙の表現がより多様で意味的意味のある潜在コードをもたらし、後方分布崩壊を軽減することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。