Skip to main content
QUICK REVIEW

[論文レビュー] Text Generation with Diffusion Language Models: A Pre-training Approach with Continuous Paragraph Denoise

Zhenghao Lin, Yeyun Gong|arXiv (Cornell University)|Dec 22, 2022
Topic Modeling被引用数 16
ひとこと要約

本論文では、乱数ノイズを段階的に除去することで一貫性のあるシーケンスに変換する拡散ベースのデコーダーを用いて、テキストを反復的に生成する大規模な事前学習済み拡散言語モデルであるGENIEを紹介する。本研究では、連続的パラグラフノイズ除去(CPD)と呼ばれる新しい事前学習目的を提案し、自己回帰的モデルと同等の性能を達成するとともに、XSum、CNN/DailyMail、Gigaword、CommonGenベンチマークにおいて生成の多様性が向上した。

ABSTRACT

In this paper, we introduce a novel dIffusion language modEl pre-training framework for text generation, which we call GENIE. GENIE is a large-scale pretrained diffusion language model that consists of an encoder and a diffusion-based decoder, which can generate text by gradually transforming a random noise sequence into a coherent text sequence. To pre-train GENIE on a large-scale language corpus, we design a new continuous paragraph denoise objective, which encourages the diffusion-decoder to reconstruct a clean text paragraph from a corrupted version, while preserving the semantic and syntactic coherence. We evaluate GENIE on four downstream text generation benchmarks, namely XSum, CNN/DailyMail, Gigaword, and CommonGen. Our experimental results show that GENIE achieves comparable performance with the state-of-the-art autoregressive models on these benchmarks, and generates more diverse text samples. The code and models of GENIE are available at https://github.com/microsoft/ProphetNet/tree/master/GENIE.

研究の動機と目的

  • シーケンスからシーケンスへのテキスト生成を目的とした大規模な事前学習済み拡散言語モデルの開発。
  • 自己回帰的モデルの限界(露出バイアスや遅い生成速度)を解消するため、非自己回帰的拡散生成を活用すること。
  • 段落レベルの整合性とノイズ除去能力を向上させる新しい事前学習目的の設計。
  • 標準的なテキスト生成ベンチマークにおける拡散ベース生成の有効性を評価し、モデルの挙動を分析すること。
  • 拡散ベースの精練によって、高品質で一貫性のある出力を維持しながら生成の多様性を向上させること。

提案手法

  • GENIEはエンコーダ・デコーダアーキテクチャを採用しており、双方向エンコーダが入力を処理し、拡散ベースのデコーダがノイズののった潜在表現から出力を生成する。
  • 拡散デコーダーは、逆方向の拡散プロセスを用いて、複数の時間ステップにわたりランダムなガウスノイズのシーケンスを一貫性のあるテキストシーケンスに段階的にノイズ除去する。
  • 洗練された事前学習目的として、連続的パラグラフノイズ除去(CPD)が導入され、意味的・文法的構造を保持したまま、損傷を加えたバージョンから元のパラグラフを再構築する能力をモデルに要求する。
  • CPD目的は、文脈とノイズ入り入力を条件として、各時間ステップで追加されたノイズを予測するノイズ除去タスクとして定式化される。
  • モデルは、CPD目的を用いて大規模なラベルなしテキストコーパス上でエンドツーエンドに事前学習され、頑健な表現を学習する。
  • 推論時、モデルはランダムノイズから出発し、エンコーダの隠れ状態に従ってガイドされる逆方向拡散プロセスを適用することでテキストを生成する。

実験結果

リサーチクエスチョン

  • RQ1拡散ベースの言語モデルは、最先端の自己回帰的モデルと同等の性能を達成できるか?
  • RQ2提案された連続的パラグラフノイズ除去(CPD)事前学習目的は、一貫性があり意味的に正確なテキストを再構築する能力を向上させるか?
  • RQ3拡散ステップ数が生成テキストの品質と多様性に与える影響は何か?
  • RQ4大規模コーパスでの事前学習が、拡散言語モデルの一般化能力と生成品質をどの程度向上させるか?
  • RQ5拡散ベース生成フレームワークは、自己回帰的ベースラインと比較してより多様な出力を生成できるか?

主な発見

  • GENIEはXSum、CNN/DailyMail、Gigaword、CommonGenという4つの主要なテキスト生成ベンチマークで競争力のある性能を示し、自動評価指標において最先端の自己回帰的モデルと同等またはそれを上回った。
  • 自動評価指標による生成の多様性の向上が顕著に観察され、拡散ベース生成がより多様な出力を可能にしていることが示された。
  • 連続的パラグラフノイズ除去(CPD)事前学習目的は、損傷を加えた入力から一貫性があり意味的に正確なテキストを回復する能力を効果的に向上させた。
  • 逆方向拡散ステップ数を増やすことで生成品質が向上し、1000ステップで安定化する。ステップ数が少ないと著しい劣化が生じた。
  • 事前学習中に均一サンプリングを用いる方が、損失に配慮したサンプリングよりも下流性能で優れており、均一サンプリングが全時間ステップにわたる知識学習を促進していることが示唆された。
  • アブレーションスタディにより、事前学習ステップ数と拡散ステップ数の両方がモデル性能に顕著な影響を持つことが確認され、より長い事前学習と十分な拡散ステップ数が最適な結果をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。