[論文レビュー] Non-aligned supervision for Real Image Dehazing
本稿では、非対応の曇りガラス画像と明るい画像のペアを用いて、マルチスケールリファレンス損失を用いて訓練する非対応の監視フレームワークであるNSDNetを提案する。自己注意機構を用いて暗いチャネルの事前知識をガイドにした無限大の大気光をモデル化し、チャネル注意機構を用いて透過率を推定することで、実世界のデータセット、特に415組のモバイルカメラで撮影された画像ペアを含む新しいPhone-Hazyベンチマークで最先端の性能を達成する。
Removing haze from real-world images is challenging due to unpredictable weather conditions, resulting in the misalignment of hazy and clear image pairs. In this paper, we propose an innovative dehazing framework that operates under non-aligned supervision. This framework is grounded in the atmospheric scattering model, and consists of three interconnected networks: dehazing, airlight, and transmission networks. In particular, we explore a non-alignment scenario that a clear reference image, unaligned with the input hazy image, is utilized to supervise the dehazing network. To implement this, we present a multi-scale reference loss that compares the feature representations between the referred image and the dehazed output. Our scenario makes it easier to collect hazy/clear image pairs in real-world environments, even under conditions of misalignment and shift views. To showcase the effectiveness of our scenario, we have collected a new hazy dataset including 415 image pairs captured by mobile Phone in both rural and urban areas, called "Phone-Hazy". Furthermore, we introduce a self-attention network based on mean and variance for modeling real infinite airlight, using the dark channel prior as positional guidance. Additionally, a channel attention network is employed to estimate the three-channel transmission. Experimental results demonstrate the superior performance of our framework over existing state-of-the-art techniques in the real-world image dehazing task. Phone-Hazy and code will be available at https://fanjunkai1.github.io/projectpage/NSDNet/index.html.
研究の動機と目的
- 時間的・天候的・視点的変動により、実世界の状況下で完全に一致する曇りガラス/明るい画像ペアを収集することが困難であるという課題に対処すること。
- 教師あり学習における対応制約を緩和しつつ、合成と実世界の曇りガラス画像間のドメインシフトを低減することにより、デハジング性能を向上させること。
- 暗いチャネルの事前知識をガイドに、固定の大気光を学習可能な実数値表現に置き換えることで、空間的に変化する無限大の大気光をより正確にモデル化すること。
- 3つの色チャネルにおける特徴表現を向上させるために、チャネル注意機構を用いて透過率推定を強化すること。
- 非対応の監視の有効性を、新しい実世界データセットであるPhone-Hazyと既存のベンチマークにおける比較評価を通じて実証すること。
提案手法
- フレームワークは、大気散乱モデルに基づいた3つの相互接続されたネットワーク(デハジング、大気光、透過率)から構成される。
- ピクセル単位の対応が不要なため、非対応の明るいリファレンス画像との間で特徴表現を比較するマルチスケールリファレンス損失を導入し、監視を可能にする。
- 平均と分散に基づく自己注意機構を用いて無限大の大気光をモデル化し、空間的構造を保持するために暗いチャネルの事前知識を位置的ガイドとして用いる。
- 透過率マップ推定にチャネル注意モジュールを適用し、3色チャネル全体の特徴を適応的に重み付けする。
- 生成的対抗的損失と文脈的損失を組み合わせることで、リアルさと詳細の保持を向上させる。
- モバイルカメラで農村および都市部の環境で撮影された415組の曇りガラス/明るい画像ペアを含む、新しい実世界データセットPhone-Hazyを収集し、手法の妥当性を検証する。
実験結果
リサーチクエスチョン
- RQ1非対応の、登録されていない曇りガラス画像と明るい画像ペアを用いた監視でも、依然として効果的なデハジング性能を達成できるか?
- RQ2固定の大気光仮定と比較して、空間的に変化する無限大の大気光をモデル化することで、デハジング品質はどの程度向上するか?
- RQ3ピクセル単位の損失や分布単位の損失と比較して、特徴量レベルの比較に基づくマルチスケールリファレンス損失は、非対応設定でどの程度優れているか?
- RQ4暗いチャネルの事前知識をガイドにした自己注意機構は、現実世界の大気光の変動を効果的にモデル化できるか?
- RQ5RTTSやPhone-Hazyなどの実世界ベンチマークにおいて、提案手法は最先端のモデルと比較してどの程度優れているか?
主な発見
- 合成データセットのFoggy Cityscapesにおいて、NSDNetはPSNR 29.35、SSIM 0.96を達成し、Dehamer や C2PNet といった最先端モデルを含むすべての先行手法を上回る。
- 実世界のRTTSデータセットにおいて、NSDNetはFADE 0.7419、NIQE 3.6905を達成し、PMNet や DeHamer といった真値監視に依存するモデルを著しく上回る。
- Phone-HazyおよびRTTSにおける視覚的比較では、RefineNet や D4、CDD-GAN、DAD と比較して、NSDNetはより明確で自然な結果を生成し、アーチファクトが少なく、より良い詳細回復が可能である。
- アブレーションスタディにより、マルチスケールリファレンス損失と自己注意大気光モジュールが、特に不一致や複雑な実世界シーンに対処する上で性能向上に不可欠であることが確認された。
- 新しいPhone-Hazyデータセットは、緩い条件でも実世界の曇りガラス/明るい画像ペアを収集可能であることを示し、非対応デハジングフレームワークの実用的導入を可能にする。
- 都市部の道路や長距離の曇りガラス状態を含む多様な実世界シナリオにおいても、視覚的結果により、本手法の優れた一般化性能が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。