Skip to main content
QUICK REVIEW

[論文レビュー] ShadowDiffusion: When Degradation Prior Meets Diffusion Model for Shadow Removal

Lanqing Guo, Chong Wang|arXiv (Cornell University)|Dec 9, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

ShadowDiffusionは、動的マスク認識拡散モデル(DMDM)を用いて劣化事前知識と生成的事前知識を統合することで、最初の拡散ベースのシャドウ除去フレームワークを提案する。アンローリングにインspiredされたサンプリング戦略により、シャドウなし画像とシャドウマスクを同時に最適化し、SRDデータセットで34.73dBのPSNRを達成し、先行手法を顕著に上回る最先端の性能を実現する。

ABSTRACT

Recent deep learning methods have achieved promising results in image shadow removal. However, their restored images still suffer from unsatisfactory boundary artifacts, due to the lack of degradation prior embedding and the deficiency in modeling capacity. Our work addresses these issues by proposing a unified diffusion framework that integrates both the image and degradation priors for highly effective shadow removal. In detail, we first propose a shadow degradation model, which inspires us to build a novel unrolling diffusion model, dubbed ShandowDiffusion. It remarkably improves the model's capacity in shadow removal via progressively refining the desired output with both degradation prior and diffusive generative prior, which by nature can serve as a new strong baseline for image restoration. Furthermore, ShadowDiffusion progressively refines the estimated shadow mask as an auxiliary task of the diffusion generator, which leads to more accurate and robust shadow-free image generation. We conduct extensive experiments on three popular public datasets, including ISTD, ISTD+, and SRD, to validate our method's effectiveness. Compared to the state-of-the-art methods, our model achieves a significant improvement in terms of PSNR, increasing from 31.69dB to 34.73dB over SRD dataset.

研究の動機と目的

  • 深層学習ベースのシャドウ除去における境界アーチファクトと残留シャドウを解消するため、物理的劣化事前知識を統合すること。
  • 不正確または事前推定されたシャドウマスクに依存する既存手法の限界を克服すること。
  • シャドウなし画像生成とシャドウマスクの最適化を統合的に最適化する拡散フレームワークの開発。
  • ノイズ除去を超えて、複雑な劣化パターンを示す画像修復タスクにおける拡散モデルの可能性を検討すること。

提案手法

  • 空間的に変化するシャドウ劣化モデルを提案し、劣化をシャドウマスクと強度マップに分解することで、現実の照明複雑性を捉える。
  • 入力のシャドウ画像と予測マスクの両方に条件づけられる動的マスク認識拡散モデル(DMDM)を導入し、画像とマスクの共同最適化を可能にする。
  • アンローリングにインspiredされた拡散サンプリング戦略を設計し、劣化事前知識を逆方向のノイズ除去プロセスに明示的に統合することで、安定性と収束性を向上させる。
  • シャドウマスクの最適化を拡散ジェネレータ内での補助タスクとして扱い、画像修復の過程で段階的にマスクを精緻化することで、境界アーチファクトを低減する。
  • 学習中にマスクと画像の依存関係を学習できるように、拡散プロセスに4チャネルの条件入力(シャドウ画像+マスク)を採用する。
  • マスク条件を除去することで、低照度強化と露出補正にフレームワークを適応させ、これらをグローバル劣化ケースとして扱う。

実験結果

リサーチクエスチョン

  • RQ1物理的事前知識と組み合わせた拡散モデルは、現実のシャドウの複雑で空間的に変化する劣化を効果的にモデル化できるか?
  • RQ2補助タスクとしてのマスク最適化を統合することで、シャドウ除去のロバスト性と品質はどのように向上するか?
  • RQ3劣化事前知識を拡散サンプリングプロセスにアンローリングすることで、収束性とアーチファクト低減にどの程度寄与するか?
  • RQ4提案フレームワークは、シャドウ除去を越えて、低照度強化などの他の画像強化タスクにも一般化可能か?

主な発見

  • ShadowDiffusionはSRDデータセットで34.73dBのPSNRを達成し、先行の最先端手法(31.69dB)を顕著に上回った。
  • アンローリングを含む完全なモデルは、DMDMオンリーバリエーションよりもSRDデータセットで0.21dB高いPSNRを達成し、アンローリング戦略の有効性を示した。
  • アンローリングフレームワークは、サンプリングの安定性と収束速度を向上させ、最終生成物のアーチファクトと不安定性を低減した。
  • 明示的なマスク最適化がなくても、DMDMオンリーバリエーションは、SR3 や WeatherDiffusion といった既存の拡散モデルを上回った。これは、提案された条件付け機構の強力さを示している。
  • 低照度強化と露出補正の両タスクにおいても、良好な一般化性能を示し、それぞれ27.36dBと22.33dBのPSNRを達成し、最先端の結果を出した。
  • 視覚的結果では、BMNet や Fu et al. と比較して、ShadowDiffusionはより自然でアーチファクトのない出力を得ており、境界が明瞭であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。