Skip to main content
QUICK REVIEW

[論文レビュー] Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution

Aaron Lou, Chenlin Meng|arXiv (Cornell University)|Oct 25, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、自然言語データにおける安定的かつスケーラブルな拡散モデルの訓練を可能にする、新しい離散スコアマッチング損失であるスコアエントロピー離散拡散(SEDD)を紹介する。原理的なスコアエントロピー目的関数を用いてデータ分布の比を推定することで、SEDDはGPT-2レベルのパープレキシティを達成するとともに、計算量と品質のトレードオフ、忠実な分布学習(GPT-2比で4倍優れている)、および自己回帰的生成を超えた任意のインフィルリンぐ能力を実現する。

ABSTRACT

Despite their groundbreaking performance for many generative modeling tasks, diffusion models have fallen short on discrete data domains such as natural language. Crucially, standard diffusion models rely on the well-established theory of score matching, but efforts to generalize this to discrete structures have not yielded the same empirical gains. In this work, we bridge this gap by proposing score entropy, a novel loss that naturally extends score matching to discrete spaces, integrates seamlessly to build discrete diffusion models, and significantly boosts performance. Experimentally, we test our Score Entropy Discrete Diffusion models (SEDD) on standard language modeling tasks. For comparable model sizes, SEDD beats existing language diffusion paradigms (reducing perplexity by $25$-$75$\%) and is competitive with autoregressive models, in particular outperforming GPT-2. Furthermore, compared to autoregressive mdoels, SEDD generates faithful text without requiring distribution annealing techniques like temperature scaling (around $6$-$8 imes$ better generative perplexity than un-annealed GPT-2), can trade compute and quality (similar quality with $32 imes$ fewer network evaluations), and enables controllable infilling (matching nucleus sampling quality while enabling other strategies besides left to right prompting).

研究の動機と目的

  • 自然言語生成における離散拡散モデルのための有効なスコアマッチング手法の不足に対処すること。
  • 自己回帰モデル(GPT-2など)と同等の高品質な離散拡散モデリングを可能にする、安定的かつスケーラブルな訓練目的関数を開発すること。
  • 計算量と品質のトレードオフや、標準的な左から右への自己回帰的生成を超えたアルゴリズム的利点(例えば、任意のインフィルリンぐ)を可能にすること。
  • 非自己回帰的拡散モデルが、言語モデリングタスクにおいてスケールに応じて自己回帰的モデルと同等の性能を達成できることを示すこと。

提案手法

  • 摂動されたデータ分布の比を推定する新しい離散スコアマッチング損失「スコアエントロピー」を提案し、最大尤度訓練のための変分下界(ELBO)を形成する。
  • 明示的な密度推定を必要とせず、効率的な最適化が可能な、スコアエントロピー損失のノイズ除去変種を導出する。
  • スコアに基づく祖先サンプリング法と、シーケンス内の任意のマスキングされた位置に条件づける一般化されたインフィルリンぐ手順を導入する。
  • アーキテクチャの改善と効率的な訓練技術を用いて、SEDDモデルをGPT-2のモデルサイズまでスケーリングする。
  • 離散空間に適応した連続時間SDEフレームワークを採用し、スコア関数をログ摂動密度の勾配を予測するニューラルネットワークとしてモデル化する。
  • 真のデータ密度への直接アクセスが不要なノイズ除去目的関数を用いることで、スコア関数の近似を可能にし、訓練の安定性を向上させる。
Figure 1: The graphs of $\mathcal{L}_{\rm CSM}$ versus $\mathcal{L}_{\rm SE}$ for a ground truth score of $0.2$ . The score entropy loss respects nonnegativity.
Figure 1: The graphs of $\mathcal{L}_{\rm CSM}$ versus $\mathcal{L}_{\rm SE}$ for a ground truth score of $0.2$ . The score entropy loss respects nonnegativity.

実験結果

リサーチクエスチョン

  • RQ1自然言語モデリングに適した安定的かつスケーラブルな離散スコアマッチング損失を設計できるか。これにより、拡散モデルが自己回帰的ベースラインに匹敵する性能を達成できるか。
  • RQ2提案されたスコアエントロピー損失は、GPT-2のような標準的な自己回帰的モデルと比較して、より優れた分布の忠実性を実現するか。
  • RQ3SEDDモデルは、パープレキシティが競争的であると同時に、任意のインフィルリンぐや計算量と品質のトレードオフといった新たな機能を実現できるか。
  • RQ4SEDDの性能は、尤度、サンプル品質、推論効率の観点からGPT-2と比較してどうなるか。

主な発見

  • SEDDは、同サイズのモデルにおいてGPT-2の+10%以内のパープレキシティスコアを達成し、一部の設定では自己回帰的ベースラインを上回ることを確認した。
  • SEDDモデルはより忠実なシーケンス分布を学習し、祖先サンプリングを用いた大規模言語モデルによる評価で、GPT-2比で約4倍の分布の忠実性を達成した。
  • SEDDは計算量と品質のトレードオフを実現し、GPT-2と同等の生成品質に到達するためのネットワーク評価回数をわずか16分の1にまで削減できた。
  • SEDDは任意のインフィルリンぐをサポートし、標準的な自己回帰的モデルが左から右への生成に制限されるのとは異なり、シーケンス内の任意のマスキングされた位置に条件づけることが可能である。
  • スコアエントロピー損失は安定的であり、有効なELBOを形成しており、離散拡散モデルにおける原理的で最大尤度の訓練を可能にする。
  • スコアエントロピー損失のノイズ除去バージョンは、明示的な密度推定や複雑なサンプリングスキームを必要とせず、効率的な最適化を可能にする。
(a) Generative Perplexity vs. Sampling Iterations.
(a) Generative Perplexity vs. Sampling Iterations.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。