Skip to main content
QUICK REVIEW

[論文レビュー] Refining Generative Process with Discriminator Guidance in Score-based Diffusion Models

Dongjun Kim, Yeongmin Kim|arXiv (Cornell University)|Nov 28, 2022
Generative Adversarial Networks and Image Synthesis被引用数 13
ひとこと要約

本稿では、事前学習済みのスコアベースの拡散モデルにおけるサンプル生成を、ノイズ除去スコア経路にディスクライマによる補正を追加することで改善する、Discriminator Guidanceという手法を提案する。スコアモデルの学習後にディスクライマを別途訓練し、そのフィードバックをステアリング項として統合することで、ImageNet 256x256でFID 1.83、リ콜 0.64という最先端の性能を達成し、実データの統計と非常に近い結果(FID 1.68、リコール 0.66)を再現した。

ABSTRACT

The proposed method, Discriminator Guidance, aims to improve sample generation of pre-trained diffusion models. The approach introduces a discriminator that gives explicit supervision to a denoising sample path whether it is realistic or not. Unlike GANs, our approach does not require joint training of score and discriminator networks. Instead, we train the discriminator after score training, making discriminator training stable and fast to converge. In sample generation, we add an auxiliary term to the pre-trained score to deceive the discriminator. This term corrects the model score to the data score at the optimal discriminator, which implies that the discriminator helps better score estimation in a complementary way. Using our algorithm, we achive state-of-the-art results on ImageNet 256x256 with FID 1.83 and recall 0.64, similar to the validation data's FID (1.68) and recall (0.66). We release the code at https://github.com/alsdudrla10/DG.

研究の動機と目的

  • スコアモデルの微調整なしに、高精細で多様なサンプルを生成できるように、事前学習済みの拡散モデルの限界を是正すること。
  • 生成過程における補完的監視を導入することで、分類器ガイドドサンプリングにおけるモード崩壊や品質劣化を是正すること。
  • スコアモデルの事前学習後に安定的かつ高速にディスクライマを訓練できる仕組みを提供し、GANで一般的に見られる共同最適化の問題を回避すること。
  • 軽量で事後的な微調整メカニズムを用いて、同時にサンプル品質(FID)とクラス内多様性(リコール)を向上させること。
  • スコアモデルの再訓練なしに、既存の拡散モデルに即座に統合可能なプラグイン型ソリューションを提供すること。

提案手法

  • スコアモデルの事前学習後に独立してディスクライマを訓練し、全ノイズスケールにわたって実データと生成データを分類する。
  • ディスクライマの出力に基づき、事前学習済みスコア関数に補正項を追加し、ノイズ除去経路をより現実的となる領域へと誘導する。
  • 補正項は、定理1から導かれる最適ディスクライマにおける、モデルスコアと真のデータスコアの差を近似する。
  • ガイドドノイズ除去プロセスを用いて、修正されたスコア関数をサンプリング段階で適用し、実用性を向上させる。
  • 理論的基盤として連続時間SDEフレームワークを用いるが、本手法は離散的および連続的両設定に適用可能である。
  • ディスクライマの勾配を活用してスコア補正をガイドすることで、生成サンプルが実データと区別不能になるように保証する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みのスコアベースの拡散モデルは、スコアネットワークの再訓練なしに、より高品質かつ多様なサンプルを生成できるか?
  • RQ2生成過程において、ディスクライマが安定的で効果的かつ補完的な監視を提供できるか? これにより、実用性と多様性が向上するか?
  • RQ3スコアモデルの学習後にディスクライマを訓練することで、共同最適化が困難なGANの不安定性や複雑さを回避しつつ、生成品質を向上できるか?
  • RQ4ディスクライマのフィードバックを数学的に形式化し、真のデータスコアと整合するようにスコア関数を補正できるか?
  • RQ5本手法は、最小限の計算コストで、ImageNet 256x256のようなベンチマークデータセットで、どれほど最先端の性能を達成できるか?

主な発見

  • 提案手法のDiscriminator Guidanceは、ImageNet 256x256でFID 1.83、リコール 0.64という、新たな最先端の性能を達成し、実データ統計(FID 1.68、リコール 0.66)に極めて近い結果を再現した。
  • CIFAR-10では、EDM-G++を用いてFID 1.77、条件付き生成ではFID 1.64を達成し、さまざまな設定で優れた性能を示した。
  • CelebA/FFHQ 64x64でも、Soft Truncation-G++を用いてFID 1.34を達成し、高精細な顔生成において有効性を示した。
  • 本手法はFIDとリコールの両方を同時に向上させ、分類器ガイドドサンプリングでよく見られるモード崩壊を回避した。
  • ディスクライマの訓練は安定的かつ高速に収束し、計算コストが最小限に抑えられており、表6および図3で示された通りである。
  • 視覚的サンプル(図32~51)から、Discriminator Guidanceが複数のクラスおよびデータセットにわたり、現実的で多様かつ高精細な画像を生成できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。