Skip to main content
QUICK REVIEW

[論文レビュー] Generic Model-Agnostic Convolutional Neural Network for Single Image Dehazing

Zheng Liu, Botao Xiao|arXiv (Cornell University)|Oct 5, 2018
Image Enhancement Techniques被引用数 9
ひとこと要約

本論文は、大気散乱モデルに依存せず、大気に散乱する光(A)や透過率(t)の推定を必要とせずに、はっきりした画像を直接学習する汎用的でモデルに依存しない畳み込みニューラルネットワーク(GMAN)を提案する。エンドツーエンドのエンコーダ・デコーダアーキテクチャに残差ブロックを組み合わせたこのアプローチは、SOTS屋外データセットにおいてPSNR 28.19、SSIM 0.9638という最先端の性能を達成し、既存の手法を上回っている。

ABSTRACT

Haze and smog are among the most common environmental factors impacting image quality and, therefore, image analysis. This paper proposes an end-to-end generative method for image dehazing. It is based on designing a fully convolutional neural network to recognize haze structures in input images and restore clear, haze-free images. The proposed method is agnostic in the sense that it does not explore the atmosphere scattering model. Somewhat surprisingly, it achieves superior performance relative to all existing state-of-the-art methods for image dehazing even on SOTS outdoor images, which are synthesized using the atmosphere scattering model. Project detail and code can be found here: https://github.com/Seanforfun/GMAN_Net_Haze_Removal

研究の動機と目的

  • 大気散乱モデルに依存し、Aやt(x)のパラメータ推定を行うモデル依存の除霧手法の限界を是正すること。
  • Aとt(x)の推定を一切行わず、はっきりした画像を直接復元できる汎用的でエンドツーエンドのディープラーニングフレームワークの開発。
  • 一般化性能の向上と、既存手法で見られる色のずれやエッジの過剰な鋭化といった一般的なアーチファクトの回避。
  • 除霧を越えて画像復元の分野に応用可能な、より汎用的でアーキテクチャに依存しないアプローチの可能性の探求。

提案手法

  • 各層に64フィルタ(ダウンサンプリング時のみ128)を用い、$3\times3$カーネルとReLU活性化関数を採用する、完全畳み込み型のエンコーダ・デコーダネットワーク。
  • 階層的なはっきりした特徴を学習し、勾配の流れを改善するために、深さが増す(2, 2, 3, 4層の畳み込み層を有する)4つの残差ブロックを採用。
  • ピixcel単位のL2損失関数を用いてエンドツーエンドで学習:$L = \sum_{i} \| \hat{Y}_i - Y_i \|^2$、再構成誤差を最小化。
  • 学習時には$224\times224$の入力サイズを用い、ランダムクロッピングを実施するが、推論時には任意の入力サイズをサポート。
  • Adam最適化法を用い、初期値学習率0.001、$\beta_1=0.9$、$\beta_2=0.999$、NVIDIA Titan Xp GPU上でのバッチサイズ35で学習。
  • 損失が0.0004に収束するまで20エポック学習させ、収束が安定的かつ効果的であることを示した。

実験結果

リサーチクエスチョン

  • RQ1モデルに依存しないディープラーニングアプローチが、大気散乱モデルに依存する最先端の手法を上回ることができるか?
  • RQ2Aとt(x)の推定を一切行わず、エンドツーエンドの画像復元を直接行うことで、より良い一般化性能と少ないアーチファクトが得られるか?
  • RQ3汎用的で完全畳み込み型のアーキテクチャが、合成データおよび実世界の除霧ベンチマークの両方で優れた性能を達成できるか?
  • RQ4Aとt(x)のパラメータ推定を必要としない本手法は、色再現性とエッジ保持性において、プラグインベースの手法と比べてどのように差をつけるか?
  • RQ5GMANのような汎用的アーキテクチャは、除霧を越えて他の画像復元タスクへどの程度一般化可能か?

主な発見

  • SOTS屋外データセットでは、GMANはPSNR 28.19、SSIM 0.9638を達成し、DCP、DehazeNet、MSCNN、AOD-Net、GFNを含むすべての比較手法を顕著に上回った。
  • GMANは、DCPでは見られる色の濃くなる現象や、MSCNNでは顕著なエッジの過剰鋭化といった一般的なアーチファクトを回避した。
  • SOTS屋内データセットでは、PSNR 20.53、SSIM 0.8081を達成し、比較対象手法の中では4位にランクされたが、屋内シーンでは優位性は限定的であった。
  • 大気散乱モデルでは完全に捉えきれない複雑なはっきりの構造に対しても、GMANは頑健であることが示され、より汎用的な特徴を学習している可能性を示唆した。
  • 20エポック経過後に損失が0.0004に収束し、安定的かつ効果的な最適化が行われたことが示された。
  • 結果から、モデルに依存しないエンドツーエンド学習が、特に画像品質と自然な外観の保持において、モデルベースのプラグイン手法を上回ることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。