Skip to main content
QUICK REVIEW

[論文レビュー] Towards Domain Invariant Single Image Dehazing

Pranjay Shyam, Kuk‐Jin Yoon|arXiv (Cornell University)|Jan 9, 2021
Image Enhancement Techniques参考文献 50被引用数 6
ひとこと要約

本稿では、空間的に注意を向けるチャネル注意機構とグリーディー局所的データ拡張を用いて、非一様なハゼ分布に対処するドメイン不変の単一画像除霧フレームワークを提案する。低周波数および高周波数の事前知識を活用した二重判別器の adversarial フレームワーク内で訓練された本手法は、実世界および合成データセットの両方で最先端の性能を達成し、多様なドメインおよびハゼ密度に対して堅牢であることを示した。

ABSTRACT

Presence of haze in images obscures underlying information, which is undesirable in applications requiring accurate environment information. To recover such an image, a dehazing algorithm should localize and recover affected regions while ensuring consistency between recovered and its neighboring regions. However owing to fixed receptive field of convolutional kernels and non uniform haze distribution, assuring consistency between regions is difficult. In this paper, we utilize an encoder-decoder based network architecture to perform the task of dehazing and integrate an spatially aware channel attention mechanism to enhance features of interest beyond the receptive field of traditional conventional kernels. To ensure performance consistency across diverse range of haze densities, we utilize greedy localized data augmentation mechanism. Synthetic datasets are typically used to ensure a large amount of paired training samples, however the methodology to generate such samples introduces a gap between them and real images while accounting for only uniform haze distribution and overlooking more realistic scenario of non-uniform haze distribution resulting in inferior dehazing performance when evaluated on real datasets. Despite this, the abundance of paired samples within synthetic datasets cannot be ignored. Thus to ensure performance consistency across diverse datasets, we train the proposed network within an adversarial prior-guided framework that relies on a generated image along with its low and high frequency components to determine if properties of dehazed images matches those of ground truth. We preform extensive experiments to validate the dehazing and domain invariance performance of proposed framework across diverse domains and report state-of-the-art (SoTA) results.

研究の動機と目的

  • ドメインシフトおよび非一様なハゼ分布のための合成データセットと実世界データセットの間の性能ギャップを解消すること。
  • 標準的な畳み込みカーネルの固定受容 field を超えて特徴の受容 field を拡大することで、除霧画像における特徴の一貫性と構造的保存性を向上させること。
  • 周波数ベースの事前知識を用いた adversarial 学習により、多様なハゼ密度および未知のドメインへの一般化を確保すること。
  • 従来の手法が合成データ生成において手作業で設計した事前知識や一様なハゼ仮定に依存するという限界を克服すること。
  • エンドツーエンドで学習可能なアーキテクチャを用いて、強いドメイン不変性を達成し、最先端の除霧性能を実現すること。

提案手法

  • マルチスケール特徴を捉え、晴れ渡った画像を再構築するため、エンコーダ・デコーダ型の UNet アーキテクチャを採用する。
  • 標準的な畳み込みの固定受容 field を超えて特徴を強化するため、空間的に注意を向けるチャネル注意(SATA)モジュールを導入する。
  • ノイズのある画像からパッチをコピーすることで、綺麗な画像に非一様なハゼを合成するため、グリーディー局所的データ拡張(GLDA)を適用する。
  • 低周波数(LF)および高周波数(HF)成分のための別個の判別器を用いた、事前知識に基づく生成的 adversarial フレームワーク内でネットワークを訓練する。
  • LF および HF 成分を事前知識として用い、実際の除霧画像と生成画像を区別するように判別器をガイドすることで、色および構造的一致性を促進する。
  • リアルさと忠実度を向上させるために、L1、知覚的、および adversarial 損失を組み合わせた損失関数を最適化することで生成器を最適化する。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースの除霧モデルは、非一様および実世界の条件を含む多様なハゼ分布において一貫した性能を発揮できるか?
  • RQ2空間的に注意を向けるチャネル注意は、標準的な畳み込みカーネルの受容 field を超えて特徴表現を向上させるのにどの程度有効か?
  • RQ3グリーディー局所的データ拡張は、合成学習データにおける非一様なハゼパターンへの一般化をどの程度向上させるか?
  • RQ4adversarial フレームワークにおける周波数ベースの事前知識(LF および HF 成分)は、除霧出力における構造的および色的一致性を向上させるか?
  • RQ5二重判別器(LF および HF)の統合は、標準的な GAN や単一判別器の構成と比較して、より優れたドメイン不変性をもたらすか?

主な発見

  • NTIRE-18 ベンチマークでは、PSNR 24.14、SSIM 0.80 を達成し、SOTA ベースラインを含むすべての先行手法を上回った。
  • 分布外のテストセットを表す Haze-RD データセットでは、PSNR 21.42、SSIM 0.81 を維持し、PSNR が 16 を下回る強力なベースラインと比べ顕著に優れた性能を示した。
  • アブレーションスタディの結果、GLDA、SATA、MSFA、および二重判別器を組み合わせた場合、NTIRE-19 で PSNR 19.47、SSIM 0.75 を達成し、SOTS-IN では PSNR 38.91、SSIM 0.98 を達成し、優れた性能と堅牢性を示した。
  • LF および HF 事前知識に基づく判別器を追加することで、単純な判別器と比較して PSNR が 3.45、SSIM が 0.03 向上し、構造的および色の忠実度を保持する役割を確認した。
  • 視覚的分析により、本手法は従来手法が残留ハゼやテクスチャの歪みを残すのと異なり、より完全にハゼを除去しながら物体の構造と色を保持していることが確認された。
  • NTIRE-18 および Haze-RD の両方で一貫した性能を示したため、本フレームワークは未知のドメインに対しても効果的に一般化できることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。