Skip to main content
QUICK REVIEW

[論文レビュー] Latent Diffusion for Language Generation

Justin Lovelace, Varsha Kishore|arXiv (Cornell University)|Dec 19, 2022
Topic Modeling被引用数 15
ひとこと要約

本稿では、事前学習済みエンコーダデコーダモデル(例:BART、T5)を活用して、テキストの高品質な潜在空間を学習するLatent Diffusion for Language Generation(LD4LG)を提案する。この潜在空間は連続的かつ圧縮されたものであり、そこでの拡散により、効率的かつ高品質な言語生成が可能になる。LD4LGは、非条件的、クラス条件付き、シーケンス・トゥ・シーケンス生成の各タスクで最先端の性能を達成し、従来の拡散ベースのモデルと比較して著しく少ないサンプリングステップ数で優れた結果を示している。

ABSTRACT

Diffusion models have achieved great success in modeling continuous data modalities such as images, audio, and video, but have seen limited use in discrete domains such as language. Recent attempts to adapt diffusion to language have presented diffusion as an alternative to existing pretrained language models. We view diffusion and existing language models as complementary. We demonstrate that encoder-decoder language models can be utilized to efficiently learn high-quality language autoencoders. We then demonstrate that continuous diffusion models can be learned in the latent space of the language autoencoder, enabling us to sample continuous latent representations that can be decoded into natural language with the pretrained decoder. We validate the effectiveness of our approach for unconditional, class-conditional, and sequence-to-sequence language generation. We demonstrate across multiple diverse data sets that our latent language diffusion models are significantly more effective than previous diffusion language models.

研究の動機と目的

  • 離散的テキスト生成に拡散モデルを適用する課題に取り組むこと。これは、連続的モダリティと比較して、離散トークンの直接的モデリングが自然ではないためである。
  • 従来の拡散言語モデルがしばしば低いサンプル品質と過剰なサンプリングステップ数を抱えるという限界を克服すること。
  • 事前学習済みエンコーダデコーダモデルの強みを活かし、効率的な拡散を可能にする、固定長の圧縮された潜在表現を学習すること。
  • 離散的な言語の性質を事前学習済みデコーダーによって保持しつつ、連続的潜在空間における拡散プロセスを用いて、高品質で多様かつ制御可能なテキスト生成を可能にすること。
  • 事前学習済みオートエンコーダと潜在拡散を組み合わせることで、非条件的、条件付き、シーケンス・トゥ・シーケンス生成の各タスクにおいて優れた性能が得られることを示すこと。

提案手法

  • 本手法は、事前学習済みエンコーダデコーダモデル(例:BART や T5)を用いて、入力テキストを高次元の潜在表現に変換する。
  • 学習可能な圧縮モジュールが、これらの高次元で入力長に依存する表現を、拡散モデリングに適した低次元で固定長の潜在空間にマッピングする。
  • 対応する再構成ネットワークが、固定長の潜在コードを高次元特徴に再構成し、事前学習済みデコーダのクロスアテンションコンテキストとして使用する。
  • ノイズ除去拡散モデルを、圧縮された潜在空間で学習させ、連続的潜在系列を生成した後、自然言語に再構成する。
  • サンプリングは、潜在空間におけるガウスノイズからのノイズ除去を経て、学習済みデコーダネットワークによる再構成によって行われる。
  • 本アプローチは、高レベルの意味的モデリング(潜在空間における拡散)と離散トークン生成(事前学習済みデコーダによる)を分離することで、効率的かつ高品質な生成を実現する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みオートエンコーダの学習済み潜在空間で動作させることで、離散的テキスト生成に拡散モデルを効果的に適用できるか?
  • RQ2高次元で可変長の潜在表現と比較して、固定長の潜在表現を学習することで、テキスト生成の効率性と品質が向上するか?
  • RQ3生成品質とサンプリング効率の観点から、潜在拡散は自己回帰モデルや従来の拡散ベース言語モデルと比較してどのように差をつけるか?
  • RQ4潜在拡散フレームワークは、非条件的、クラス条件付き、シーケンス・トゥ・シーケンス生成といった多様な生成タスクをサポートできるか?
  • RQ5強力な自己回帰ベースラインと比較して、本手法は記憶の抑制を図り、制御性を向上させられるか?

主な発見

  • ROCStoriesデータセットにおいて、LD4LGは250ステップのサンプリングでMAUVEスコア0.716を達成し、2000ステップで0.043MAUVEを達成するDiffusion-LMを著しく上回った。
  • XSum要約ベンチマークでは、LD4LGは250ステップでROUGE-Lスコア31.9を達成し、2000ステップで14.1ROUGE-Lを達成するDiffuSeqを上回った。
  • 本手法は、強力な自己回帰ベースラインと比較して、記憶の抑制が顕著に改善され、クラス条件付き生成においても性能向上を示した。
  • 圧縮モジュールの使用により、可変長で高次元のエンコーダ特徴がもたらす課題を克服し、固定長潜在空間での効果的な拡散が可能になった。
  • 少ないサンプリングステップ数で高品質なテキスト生成が実現され、潜在拡散が言語モデリングに於いて効率的かつスケーラブルであることが示された。
  • フレームワークは複数のアーキテクチャ(例:BART-Base、FLAN-T5-base)およびタスクに一般化可能であり、多様なデータセットで一貫した性能向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。