Skip to main content
QUICK REVIEW

[論文レビュー] Progressive Feature Fusion Network for Realistic Image Dehazing

Kangfu Mei, Aiwen Jiang|arXiv (Cornell University)|Oct 4, 2018
Image Enhancement Techniques参考文献 26被引用数 14
ひとこと要約

本稿では、大気散乱モデルに依存しない、hazy画像からclear画像への非線形変換を直接学習するエンドツーエンドのU-Netに類似した深層学習モデル、Progressive Feature Fusion Network (PFF-Net) を提案する。エンコーダ・デコーダアーキテクチャに段階的特徴融合を採用することで、SOTSおよびNTIRE2018ベンチマークで最先端の性能を達成し、GPUメモリ使用量を効率的に抑えながら4K解像度の画像を効果的に脱着することができ、優れた知覚的品質を実現した。

ABSTRACT

Single image dehazing is a challenging ill-posed restoration problem. Various prior-based and learning-based methods have been proposed. Most of them follow a classic atmospheric scattering model which is an elegant simplified physical model based on the assumption of single-scattering and homogeneous atmospheric medium. The formulation of haze in realistic environment is more complicated. In this paper, we propose to take its essential mechanism as "black box", and focus on learning an input-adaptive trainable end-to-end dehazing model. An U-Net like encoder-decoder deep network via progressive feature fusions has been proposed to directly learn highly nonlinear transformation function from observed hazy image to haze-free ground-truth. The proposed network is evaluated on two public image dehazing benchmarks. The experiments demonstrate that it can achieve superior performance when compared with popular state-of-the-art methods. With efficient GPU memory usage, it can satisfactorily recover ultra high definition hazed image up to 4K resolution, which is unaffordable by many deep learning based dehazing algorithms.

研究の動機と目的

  • 単一散乱および均一媒質の仮定を伴う簡素化された大気散乱モデルに依存する従来の単一画像脱着手法の限界を解消すること。
  • 透過率と大気光を別々に推定するパイプラインベースの手法における誤差拡大を克服すること。
  • 中間物理変数に依存せず、hazy画像からclear画像への非線形マッピングを直接学習するエンドツーエンドでトレーニング可能なモデルを開発し、出力品質に焦点を当てる。
  • 多くの既存の深層学習ベースの脱着モデルがメモリ制約のため不可能であるが、超高精細(4K)hazy画像の効率的処理を可能にすること。

提案手法

  • 空間的詳細を保持し、効果的な特徴再利用を可能にするスキップ接続を備えたU-Netに類似したエンコーダ・デコーダアーキテクチャを提案。
  • 異なるエンコーダ段階の特徴と対応するデコーダ特徴を連結することで、段階的特徴統合を導入し、表現学習を強化。
  • 安定したトレーニングと改善された勾配伝播を実現するため、エンコーダおよびデコーダに残差ブロックを採用。
  • 予測されたclear画像と正例画像との間の標準L1損失を用いて、ネットワーク全体をエンドツーエンドでトレーニングし、再構成誤差を直接最小化。
  • 段階的トレーニング戦略を採用:まずDIV2Kで事前学習し、その後RESIDEで微調整(データオーグメンテーションなし)。
  • ほとんどの先行手法が採用するパッチベースのトレーニング戦略を避けることで、4K画像を直接処理する高解像度推論を実現。

実験結果

リサーチクエスチョン

  • RQ1大気散乱モデルの中間変数に依存しないエンドツーエンドの深層学習モデルは、大気散乱モデルに依存しないパイプラインベースの手法を上回ることができるか?
  • RQ2段階的特徴統合は、超高解像度での脱着に向けた特徴表現をどれほど向上させるか?
  • RQ3複雑なモジュール(例:密集ブロックやアンサンブル推論)を用いずに、単純な残差ブロックを備えた軽量なU-Netに類似アーキテクチャがSOTA性能を達成できるか?
  • RQ4最小限のアーキテクチャ的およびトレーニング的複雑さで、実世界の4K解像度hazy画像にどれほど一般化可能か?
  • RQ5中間変数推定に代えて、入力から出力への変換を直接エンドツーエンドで学習することは、知覚的品質および定量的指標を向上させるか?

主な発見

  • PFF-NetはSOTSベンチマークでPSNR 24.78、SSIM 0.8923を達成し、GFN(PSNR: 22.30、SSIM: 0.88)を顕著に上回った。
  • データオーグメンテーションや再トレーニングなしで、NTIRE2018脱着チャレンジのI-HAZEトラックで上位6位を達成し、公式賞の「Honorable Mention」を受賞した。
  • PFF-Netは、多くの既存の深層学習ベースの脱着モデルがメモリ制約のため不可能であるが、推論時に直接4K解像度のhazy画像を処理できた。
  • 定性的な結果から、PFF-Netは実世界のhazy画像に対して、強化されたシーンの詳細、自然な色の強調、高い知覚的品質を持つ脱着画像を生成した。
  • RESIDEでの微調整において、8エポックで収束を示し、安定的かつ効率的なトレーニングダイナミクスを示した。
  • 密集ブロックやマルチスケールテスト戦略に依存する手法と比較して、単純な残差ブロックとアンサンブル推論を一切使用しないにもかかわらず、PFF-Netはそれらを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。