Skip to main content
QUICK REVIEW

[論文レビュー] Pyramidal Denoising Diffusion Probabilistic Models

Dohoon Ryu, Jong Chul Ye|arXiv (Cornell University)|Aug 3, 2022
Image and Signal Denoising Methods被引用数 10
ひとこと要約

本稿では、位置埋め込みで条件付けられた1つのスコア関数を用いて、粗い入力から高解像度画像を生成するピラミッド型のノイズ除去拡散確率的モデルを提案する。位置符号化を用いたマルチスケール学習により、複数のモデルを訓練する必要なく、効率的かつ高精度な画像生成とスーパーサンプリングが可能となり、計算コストを低減しつつ最先端の性能を達成する。

ABSTRACT

Recently, diffusion model have demonstrated impressive image generation performances, and have been extensively studied in various computer vision tasks. Unfortunately, training and evaluating diffusion models consume a lot of time and computational resources. To address this problem, here we present a novel pyramidal diffusion model that can generate high resolution images starting from much coarser resolution images using a {\em single} score function trained with a positional embedding. This enables a neural network to be much lighter and also enables time-efficient image generation without compromising its performances. Furthermore, we show that the proposed approach can be also efficiently used for multi-scale super-resolution problem using a single score function.

研究の動機と目的

  • 画像生成およびスーパーサンプリングにおける拡散モデルの高い計算コストと遅い推論速度に対処すること。
  • 1つの軽量なスコアネットワークを用いて、粗い入力から細分化された精錬によって高解像度画像を生成すること。
  • 解像度ごとに複数の拡散モデルを訓練する必要をなくすために、位置条件付けを導入すること。
  • 異なる解像度間で統一されたスコア関数を用いることで、マルチスケールスーパーサンプリングの性能を向上させること。
  • 完全解像度のデータを一切見ない状態で、低解像度のパッチに対するパッチワイズ学習が、非常に高解像度の画像(例:1024×1024)の生成を可能にすることを実証すること。

提案手法

  • 本モデルは、入力および出力解像度が可変な状況に対応するため、位置埋め込みを条件入力として用いた1つのスコアネットワークを訓練する。
  • 座標位置に位置符号化を適用し、サインおよびコサイン関数を用いて埋め込み、マルチスケールの条件付けに適した複数チャネルに拡張する。
  • 学習段階では、入力画像を目的の解像度にランダムにリサイズし、対応する位置埋め込みを潜在特徴と連結する。
  • 逆方向の拡散プロセスでは、ノイズから開始し、解像度を段階的に向上させながら段階的ノイズ除去を行う粗いから細かい精錬戦略を採用する。
  • 本手法は、異なるサイズのパッチ(例:256×256、512×512)上でエンドツーエンドの学習を可能とし、推論時により高い解像度への一般化を実現する。
  • 本フレームワークは、すべての解像度段階で効率的なサンプリングを実現するため、CCDF加速スキームを統合する。

実験結果

リサーチクエスチョン

  • RQ1再訓練なしに、1つのスコア関数が複数の解像度で画像を生成できるか?
  • RQ2位置埋め込みへの条件付けが、正確なマルチスケール画像生成およびスーパーサンプリングを可能にするか?
  • RQ3低解像度画像のパッチワイズ学習が、完全解像度のデータを一切見ない状態で高解像度画像の生成(例:1024×1024)を可能にするか?
  • RQ4位置符号化が欠落している場合、解像度間での生成品質にどのような影響が生じるか?
  • RQ5拡散ベースの画像修復において、ピラミッド型スーパーサンプリングは直接アップスケーリングに比べてどの程度の性能向上を達成するか?

主な発見

  • FFHQにおける4倍スーパーサンプリングにおいて、提案手法はFID 66.80を達成し、バイキュービックおよびSR3を上回り、ILVR や SRGAN といった最先端手法と同等またはそれを上回った。
  • AFHQ-Dogにおける8倍スーパーサンプリングでは、FID 33.14を達成し、SR3(35.09)および ILVR(37.39)を上回った。
  • アブレーションスタディにより、位置符号化を除去すると顔の特徴がずれたり複数の目が現れるなど深刻なアーティファクトが生じ、空間的一致性を確保する上でその重要性が確認された。
  • すべての中間段階(32→64→128→256)を含むピラミッド型スーパーサンプリングが、FFHQでFID 66.80を達成し、直接アップスケーリング(32→256)のFID 72.78を上回った。
  • 本モデルは、256×256および512×512のパッチでのみ学習されたスコアネットワークから、完全に解像度の高いデータ(1024×1024)の画像を生成することに成功した。
  • 本手法は、FFHQでLPIPS 0.289、AFHQ(8倍)でSSIM 0.725を維持し、解像度を越えて高い知覚的品質と構造的一致性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。