Skip to main content
QUICK REVIEW

[論文レビュー] DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models

Zhengfu He, Tianxiang Sun|arXiv (Cornell University)|Nov 28, 2022
Topic Modeling被引用数 13
ひとこと要約

DiffusionBERTは、事前学習されたBERTと離散的拡散モデルを、共通するノイズ除去目的を活用することで組み合わせる、画期的な生成的マスク言語モデルを提案する。非マルコフ型でトークンに特化したノイズスケジュール(スパindleスケジュール)と、時間に依存しないデコード手法を導入し、従来の拡散モデルおよび自己回帰モデルと比較して、より高速な収束性、改善されたパープレキシティおよびBLEUスコアを達成する。

ABSTRACT

We present DiffusionBERT, a new generative masked language model based on discrete diffusion models. Diffusion models and many pre-trained language models have a shared training objective, i.e., denoising, making it possible to combine the two powerful models and enjoy the best of both worlds. On the one hand, diffusion models offer a promising training strategy that helps improve the generation quality. On the other hand, pre-trained denoising language models (e.g., BERT) can be used as a good initialization that accelerates convergence. We explore training BERT to learn the reverse process of a discrete diffusion process with an absorbing state and elucidate several designs to improve it. First, we propose a new noise schedule for the forward diffusion process that controls the degree of noise added at each step based on the information of each token. Second, we investigate several designs of incorporating the time step into BERT. Experiments on unconditional text generation demonstrate that DiffusionBERT achieves significant improvement over existing diffusion models for text (e.g., D3PM and Diffusion-LM) and previous generative masked language models in terms of perplexity and BLEU score.

研究の動機と目的

  • 事前学習済みのノイズ除去言語モデル(例:BERT)と拡散モデルの間のギャップを、共通するノイズ除去目的を活用することで埋める。
  • BERTを初期化として用い、逆過程を適応させることで、離散的拡散モデルの生成品質と学習効率を向上させる。
  • 画像や音声分野では成功を収めているが、離散的テキストデータへの拡散モデルの適用は未だ十分に検討されていない課題に取り組む。
  • 直前のステップに加え、元の綺麗なシーケンスにも条件づける非マルコフ型の拡散プロセスを検討し、ノイズ除去中により良い情報伝達を実現する。
  • 非自己回帰的テキスト生成における、生成品質、収束速度、推論効率のトレードオフを最適化する。

提案手法

  • 訓練コーパスにおける各トークンの頻度に基づき、個々のトークンに固有のノイズレベルを割り当てる、独自のノイズスケジュール「スパindleスケジュール」を提案。これにより、拡散プロセス全体にわたり、ノイズの影響が均等に分散される。
  • 直前の破損シーケンスに加え、元の綺麗なシーケンス $\mathbf{x}_0$ にも依存する非マルコフ型の前向き拡散プロセスを導入。これにより、ノイズ除去に richer な文脈が利用可能になる。
  • BERTを逆方向のノイズ除去ネットワーク $p_\theta(\mathbf{x}_{t-1}|\mathbf{x}_t, t)$ として適応。これにより、マスクされたトークンの再構築という事前学習済みの能力を活用できる。
  • 時間ステップ $t$ をBERTに組み込む複数の戦略を検討。最終的に、時間情報を無視する(時間に依存しないデコード)手法が最も優れた性能を示した。
  • 逆過程で $x_0$-パrameterization を採用。これにより、逆ステップ数を調整することで、推論速度を柔軟に制御可能になる。
  • 変分下界(ELBO)の目的関数を用いて、拡散軌道全体の再構築損失を最小化することで、エンド・ツー・エンドでモデルを学習。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みのノイズ除去言語モデル(例:BERT)を、テキスト生成のための離散的拡散モデルのバックボーンとして効果的に再利用できるか?
  • RQ2トークン固有のノイズスケジュール(スパindleスケジュール)は、離散的拡散モデルにおけるテキスト生成の品質と安定性にどのように影響するか?
  • RQ3逆過程を $\mathbf{x}_{t-1}$ と $\mathbf{x}_0$ の両方に条件づける(非マルコフ型プロセス)ことで、標準的なマルコフ型拡散と比較して生成品質が向上するか?
  • RQ4BERTベースのノイズ除去モデルに時間ステップ情報を組み込む最適な方法は何か?
  • RQ5BERTと拡散モデルの組み合わせは、従来の非自己回帰的または自己回帰的モデルと比較して、より優れた品質-効率トレードオフを達成できるか?

主な発見

  • DiffusionBERTは、非自己回帰的テキスト生成ベンチマークにおいて、D3PM や Diffusion-LM といった既存の拡散ベースのテキストモデルと比較して、顕著に低いパープレキシティと高いBLEUスコアを達成した。
  • D3PM よりもはるかに高速に収束し、訓練予算の30%(0.5百万ステップ)で同等の性能に到達した。
  • 時間に依存しないデコード(TAD)では、推論中に時間ステップを無視するため、時間に依存するバージョンを上回る最高の生成品質が得られた。
  • スパindleノイズスケジュールにより、シーケンス全体にわたるノイズの影響がより均等に分散され、逆過程のあらゆる段階で意味のあるテキストの再構築能力が向上した。
  • DiffusionBERTは、非自己回帰的生成における品質-分散トレードオフを優れたバランスで達成し、パープレキシティおよびデコード効率の両面で BERT-Mouth を上回った。
  • 逆ステップ数を制御することで、競争力のある生成速度を維持しながら、最先端の性能を達成した。これは、優れた品質-効率のバランスを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。