Skip to main content
QUICK REVIEW

[論文レビュー] SinDDM: A Single Image Denoising Diffusion Model

В. А. Куликов, Shahar Yadin|arXiv (Cornell University)|Nov 29, 2022
Generative Adversarial Networks and Image Synthesis被引用数 9
ひとこと要約

SinDDMは、マルチスケールの拡散プロセスとノイズレベルおよびスケールに条件付けられた軽量で完全畳み込み型のノイズ除去器を活用することで、1枚の画像のみで学習する単一画像ノイズ除去拡散モデルを提案する。この手法により、再学習やアーキテクチャの変更なしに、任意の解像度で高品質で多様な画像生成が可能となり、CLIPを用いたテキストガイド付き編集も可能となる。

ABSTRACT

Denoising diffusion models (DDMs) have led to staggering performance leaps in image generation, editing and restoration. However, existing DDMs use very large datasets for training. Here, we introduce a framework for training a DDM on a single image. Our method, which we coin SinDDM, learns the internal statistics of the training image by using a multi-scale diffusion process. To drive the reverse diffusion process, we use a fully-convolutional light-weight denoiser, which is conditioned on both the noise level and the scale. This architecture allows generating samples of arbitrary dimensions, in a coarse-to-fine manner. As we illustrate, SinDDM generates diverse high-quality samples, and is applicable in a wide array of tasks, including style transfer and harmonization. Furthermore, it can be easily guided by external supervision. Particularly, we demonstrate text-guided generation from a single image using a pre-trained CLIP model.

研究の動機と目的

  • 大規模なデータセットを必要とせず、1枚の画像から学習する生成モデルを開発すること。
  • マルチスケールの内部統計を活用することで、拡散モデルにおけるデータ不足の制限を克服し、1枚の画像での学習を可能にすること。
  • 粗〜細かい順のサンプリングにより、任意の解像度で多様で高精細な画像生成を実現すること。
  • 微調整なしに事前学習済みモデルを用いて、テキストガイド付きのコンテンツおよびスタイル編集を柔軟に可能にすること。
  • 出力サンプルの多様性と現実性を維持するとともに、元の画像からの構造的およびテクスチャ的整合性を保つこと。

提案手法

  • 各スケールでダウンサンプリングおよびぼかし処理を施した1枚の学習画像のバージョンを用いて、マルチスケールの前向き拡散プロセスを構築する。
  • ノイズレベルおよびスケールに条件付けられた軽量で完全畳み込み型のノイズ除去器を、各スケールで拡散プロセスを逆方向に学習させる。
  • 逆方向プロセスは粗〜細かい順に進行する:最も粗いスケールでノイズが徐々に除去され、その後アップサンプリングされ、次のより細かいスケールのノイズと再結合される。
  • ノイズ除去器は小さな受容 field を用いることで、局所的な統計を細かくモデル化し、テクスチャや小さな構造の現実的な再現を可能にする。
  • モデルアーキテクチャを変更せずに、事前学習済みのCLIPモデルを用いて特徴ベースの損失を介してサンプリングプロセスをガイドすることで、テキストガイド付き生成を実現する。
  • サンプリングの多様性はパディング戦略に影響を受ける。レイヤー単位のゼロパディングは境界のばらつきを低減し、初期入力パディングはそれを増加させる。

実験結果

リサーチクエスチョン

  • RQ1内部統計のみを用いて、1枚の画像で効果的にノイズ除去拡散モデルを学習できるか?
  • RQ21枚の画像から、任意の解像度で多様で高品質なサンプルを生成するには、拡散モデルがどのように設計されるべきか?
  • RQ3微調整なしに、1枚の画像拡散モデルがどれほどテキストガイド付き画像生成をサポートできるか?
  • RQ4マルチスケールアーキテクチャは、生成サンプルにおけるグローバル構造と細部の両方をどのように保持するか?
  • RQ5トレーニング画像に存在しないレアなまたは代表されていないオブジェクトを表現する際の制限は何か。また、それらはどのように緩和できるか?

主な発見

  • SinDDMは、元の画像に存在しない大規模構造や細部の新しい配置を含む、任意の解像度で多様で高精細なサンプルを生成する。
  • CLIPを用いたテキストガイド付き画像生成が成功しており、再学習やアーキテクチャ変更なしにコンテンツおよびスタイルの編集が可能である。
  • スタイルトランスファーおよびハーモナイズーションタスクにおいて、SinIRおよびConSinGANを上回り、より一貫性があり滑らかな結果を生成する。
  • モデルは、元の画像に存在しない新しいスカイラインの配置や山の角度など、訓練画像の実際のバリエーションとは異なるリアルなバリエーションを生成できる。
  • 一部のオブジェクト(例:ゾウや鳥)が過剰または不足して表現されるという制限があり、初期ステップの手動チューニングにより緩和可能だが、自動化はまだなされていない。
  • パディング設定は画像の境界におけるサンプリングの多様性に顕著な影響を及ぼし、レイヤー単位のゼロパディングは境界のばらつきを低減し、入力パディングのみではそれを増加させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。