Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Diffusion Models for Continuous Super-Resolution

Sicheng Gao, Xuhui Liu|arXiv (Cornell University)|Mar 29, 2023
Advanced Image Processing Techniques被引用数 4
ひとこと要約

本稿では、連続的画像超解像のための暗黙的拡散モデル(IDM)を提案する。このモデルは、ノイズ除去拡散と暗黙的ニューラル表現を組み合わせ、高精細で解像度連続な結果を生成する。学習可能でスケールに適応する条件付け機構を導入し、低解像度入力特徴量と生成された詳細のバランスを動的に制御することで、固定された拡大率に縛られないエンドツーエンド学習を可能にし、自然画像および顔画像超解像ベンチマークで最先端の性能を達成する。

ABSTRACT

Image super-resolution (SR) has attracted increasing attention due to its wide applications. However, current SR methods generally suffer from over-smoothing and artifacts, and most work only with fixed magnifications. This paper introduces an Implicit Diffusion Model (IDM) for high-fidelity continuous image super-resolution. IDM integrates an implicit neural representation and a denoising diffusion model in a unified end-to-end framework, where the implicit neural representation is adopted in the decoding process to learn continuous-resolution representation. Furthermore, we design a scale-controllable conditioning mechanism that consists of a low-resolution (LR) conditioning network and a scaling factor. The scaling factor regulates the resolution and accordingly modulates the proportion of the LR information and generated features in the final output, which enables the model to accommodate the continuous-resolution requirement. Extensive experiments validate the effectiveness of our IDM and demonstrate its superior performance over prior arts.

研究の動機と目的

  • 既存の超解像モデルが過剰に滑らかになりがちな点と、固定された拡大率に制限される点を是正すること。
  • 再訓練や級列アーキテクチャを必要とせず、高精細で解像度連続な画像超解像を実現すること。
  • 暗黙的ニューラル表現を拡散モデルに統合し、解像度連続な特徴学習を可能にすること。
  • 推論時に低解像度特徴量と生成された詳細の寄与度を動的に制御するスケールに適応する条件付け機構を設計すること。
  • 多様な拡大率において、定量的指標と知覚的品質の両面で最先端の性能を達成すること。

提案手法

  • モデルは、潜在表現を高解像度画像へと段階的に精錬する、ノイズ除去拡散プロセスをコアな生成メカニズムとして用いる。
  • 暗黙的ニューラル表現がU-Netデコーダーに埋め込まれており、空間座標に基づくMLPによって画像を連続関数としてモデル化する。
  • スケールに適応する条件付け機構が導入され、低解像度条件付けネットワークと学習可能なスケーリング係数から構成される。
  • スケーリング係数が、符号化された低解像度特徴量と生成されたノイズ除去特徴量の特徴マッピングを、適応的MLPを介して調節することで、連続的な解像度制御を可能にする。
  • 従来の生成的SR手法とは異なり、追加の事前知識や2段階学習を必要とせず、エンドツーエンドで訓練される。
  • モデルは8×などの多様な拡大率で学習され、推論時に分布内および分布外のスケールに対しても一般化する。

実験結果

リサーチクエスチョン

  • RQ1固定された拡大率に縛られない拡散ベースのモデルが、高精細で解像度連続な画像超解像を達成できるか?
  • RQ2暗黙的ニューラル表現を効果的に拡散モデルに統合することで、解像度連続な生成を可能にする方法は何か?
  • RQ3学習可能なスケーリング係数が、低解像度事前知識と生成された高周波数詳細のバランスを動的に制御する役割は何か?
  • RQ4事前知識なしのエンドツーエンドフレームワークが、2段階または事前知識を補完する生成的SRモデルを上回る性能を発揮できるか?
  • RQ5訓練範囲外のスケール(例:9×や10×)において、モデルはどの程度の性能を示すか?

主な発見

  • IDMは、自然画像および顔画像超解像ベンチマークで最先端の性能を達成し、PSNRとSSIMの両面で先行研究を上回っている。特に、生成的SR手法と比較してPSNRで0.50 dB、SSIMで0.03の向上を達成した。
  • CelebA-HQデータセットでは、LIIFやSR3と比較してLPIPSスコアが優れており、PSNRが低い場合でもより優れた知覚的一致性を示している。
  • 8×超解像で学習した場合、IDMは分布外のスケール(例:9×や10×)に対しても効果的に一般化し、高い知覚的品質と構造的正確性を維持している。
  • アブレーションスタディにより、スケーリング係数が低解像度事前知識と生成された詳細のバランスを制御するために不可欠であることが確認され、省略または単純な条件付けに置き換えると性能が著しく低下した。
  • 提案されたLR条件付けネットワークは、直接アップサンプリングやエンコーダー基盤の条件付けを上回り、定量的比較でよりシャープなテクスチャと正確な顔貌特徴を生成した。
  • 他の手法が2800枚を必要とするのに対し、IDMはたった800枚の訓練画像で優れた性能を達成しており、データ効率性とロバスト性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。