Skip to main content
QUICK REVIEW

[論文レビュー] Image Inpainting via Iteratively Decoupled Probabilistic Modeling

Wenbo Li, Xin Yu|arXiv (Cornell University)|Dec 6, 2022
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

この論文では、分離された確率的モデリングを用いて反復的に予測を精緻化することで、大規模な欠損領域に対する高品質で効率的な画像補填を実現するピクセルスプレッドモデル(PSM)を提案する。この手法は、高速で正確な平均予測を実現する adversarial training と、不確実性マップを生成する明示的なガウス正則化を組み合わせており、信頼性の高いピクセルの選別的精緻化を可能にする。結果として、10倍速い推論速度(10× faster inference)かつパラメータ数の20%(only 20% of the parameters)で、LDM よりも1.1 FID の改善を達成し、最先端の性能を実現した。

ABSTRACT

Generative adversarial networks (GANs) have made great success in image inpainting yet still have difficulties tackling large missing regions. In contrast, iterative probabilistic algorithms, such as autoregressive and denoising diffusion models, have to be deployed with massive computing resources for decent effect. To achieve high-quality results with low computational cost, we present a novel pixel spread model (PSM) that iteratively employs decoupled probabilistic modeling, combining the optimization efficiency of GANs with the prediction tractability of probabilistic models. As a result, our model selectively spreads informative pixels throughout the image in a few iterations, largely enhancing the completion quality and efficiency. On multiple benchmarks, we achieve new state-of-the-art performance. Code is released at https://github.com/fenglinglwb/PSM.

研究の動機と目的

  • 大規模な欠損領域に対する高品質で効率的な画像補填の課題に取り組むこと。GAN は不安定さに直面し、拡散モデルは高い計算コストを伴う。
  • GAN の最適化の効率性と確率的モデルの取り扱いやすさおよび不確実性推定の能力を統合した手法を開発すること。
  • 高品質な生成に必要な反復ステップ数を削減しつつ、写真のようなリアルさと多様性を維持すること。
  • 大規模な計算リソースや大規模事前学習に依存せずに、高解像度画像(例:512×512)に対して効率的かつスケーラブルな推論を可能にすること。

提案手法

  • モデルは反復的で分離された確率的モデリングを用い、各ステップで平均(補填結果)と分散(不確実性マップ)を並列に予測する。
  • 平均項は暗黙の adversarial training により最適化され、少ない反復ステップで高速収束と高精細な生成を実現する。
  • 分散項は明示的なガウス正則化によりモデル化され、信頼性の高い不確実性マップが生成され、精緻化のためのピクセル選択を支援する。
  • 低不確実性のピクセルのみが保持され、次に伝搬されるため、信頼できるコンテンツで徐々に欠損領域を埋める「ピクセルスプレッド」メカニズムが実現される。
  • 長距離の文脈モデリングを向上させるために、不確実性誘導型アテンション機構が導入され、構造的一致性と詳細品質が向上する。
  • 異なる反復ステップ間での訓練安定性を向上させるために、均一なマスクスケジューリング戦略が採用され、汎化性能と性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1アドバーシャルトレーニングと明示的な不確実性モデリングを組み合わせたハイブリッド手法は、自己回帰的または拡散モデルよりも少ない反復ステップで高品質な画像補填を達成できるか?
  • RQ2明示的な不確実性推定は、標準的な GAN と比較して、反復的画像補完の信頼性と品質をどの程度向上させるか?
  • RQ3強力な拡散モデルのパラメータ数の20%しか持たない軽量モデルが、大穴補填において最先端の性能を達成できるか?
  • RQ4不確実性誘導型アテンションは、高解像度画像補填において構造的一致性と詳細生成を向上させるか?

主な発見

  • Places2 ベンチマークでは、PSM は強力なノイズ除去拡散モデル LDM よりも1.1 FID の改善を達成し、パラメータ数は20%削減、推論速度は10倍高速化された。
  • PSM は512×512の画像を約250msで生成でき、LDM の約3秒の推論時間に比べて顕著に優れている。
  • 5000万枚の学習画像で学習された CoModGAN よりも、2000万枚の学習画像で学習した PSM が優れた性能を示しており、データ効率性が裏付けられた。
  • 不確実性マップにより、信頼性の高い予測の選別が効果的に行われ、GAN のアーチファクトが減少し、視覚的品質が向上していることが、定性的な比較で示された。
  • アブレーションスタディの結果、均一なマスクスケジューリングが最良の FID スコアをもたらし、反復ステップ間での訓練安定性が向上したことが確認された。
  • モデルは多様な生成をサポートし、特に部屋のレイアウトや建物のような複雑なシーンにおいて、より現実的なテクスチャと構造を生成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。