Skip to main content
QUICK REVIEW

[論文レビュー] Structure Representation Network and Uncertainty Feedback Learning for Dense Non-Uniform Fog Removal

Yeying Jin, Wending Yan|arXiv (Cornell University)|Oct 6, 2022
Image Enhancement Techniques被引用数 7
ひとこと要約

本稿では、不確実性フィードバック学習を備えた構造表現ネットワークを用いて、濃く不均一な霧を含む単一画像の除霧に向けた新規手法を提案する。DINO-ViT特徴を活用してシーン構造を回復させるとともに、大気に散乱する光の影響を軽減するためのグレースケール特徴乗数を導入し、濃い霧領域を強調する不確実性マップを用いて出力を反復的に精緻化することで、実世界の濃く不均一な霧がかかる画像において最先端の性能を達成した。

ABSTRACT

Few existing image defogging or dehazing methods consider dense and non-uniform particle distributions, which usually happen in smoke, dust and fog. Dealing with these dense and/or non-uniform distributions can be intractable, since fog's attenuation and airlight (or veiling effect) significantly weaken the background scene information in the input image. To address this problem, we introduce a structure-representation network with uncertainty feedback learning. Specifically, we extract the feature representations from a pre-trained Vision Transformer (DINO-ViT) module to recover the background information. To guide our network to focus on non-uniform fog areas, and then remove the fog accordingly, we introduce the uncertainty feedback learning, which produces the uncertainty maps, that have higher uncertainty in denser fog regions, and can be regarded as an attention map that represents fog's density and uneven distribution. Based on the uncertainty map, our feedback network refines our defogged output iteratively. Moreover, to handle the intractability of estimating the atmospheric light colors, we exploit the grayscale version of our input image, since it is less affected by varying light colors that are possibly present in the input image. The experimental results demonstrate the effectiveness of our method both quantitatively and qualitatively compared to the state-of-the-art methods in handling dense and non-uniform fog or smoke.

研究の動機と目的

  • 濃く不均一な霧による背景シーン情報の著しい劣化を解消する課題に取り組むこと。これは、従来の手法が十分に処理できない。
  • 複雑で多色の霧状態における大気光の推定が困難であるという課題を克服すること。
  • 不確実性に基づくフィードバックを導入することで、低視認性領域における除霧性能を向上させること。
  • マルチモーダル特徴正則化(ViT + CNN)を用いて、重度に霞がかかったシーンにおける幻覚を低減し、構造的詳細を保持すること。

提案手法

  • DINO-ViTを用いて自己教師付きの構造に配慮した特徴を抽出し、濃い霧下でもシーンの幾何構造と背景構造を保持する。
  • グレースケール特徴乗数を導入し、霧の劣化と色の変動を分離することで、変動する光源や散乱光に対してより強い耐性を発揮する。
  • 不確実性フィードバック機構を採用し、高密度の霧領域を強調する不確実性マップを生成し、動的アテンションのキューとして機能させる。
  • 不確実性予測に基づいて反復的に出力を精緻化するフィードバックネットワークを適用し、持続的な霧領域に焦点を当てる。
  • 2つの主要な損失関数を実装:DINO-ViT特徴を用いた構造的一致性損失と、グレースケールとRGB特徴表現の一致を保証する乗数的一致性損失。
  • クリーンな真値が不要な半教師あり学習を実施し、実際の曇り画像と合成データを用いて訓練することで、真値依存性を回避する。

実験結果

リサーチクエスチョン

  • RQ1自己教師付きビジョントランスフォーマーは、濃く不均一な霧下でも背景構造の回復を改善できるか?
  • RQ2不確実性マップは、持続的な霧領域における反復的除霧をどのようにガイドできるか?
  • RQ3グレースケール特徴表現は、複雑な霧状態における大気光の変動への感受性を低減できるか?
  • RQ4標準的なCNNと比較して、マルチモーダル特徴正則化(ViT + CNN)は除霧性能をどの程度向上させるか?
  • RQ5不確実性フィードバック学習は、重度に劣化した曇り画像における幻覚を低減し、詳細の保持を改善できるか?

主な発見

  • 提案手法は、O-HAZE、NH-Haze、Dense-Hazeベンチマークで最高のPSNRおよびSSIMスコアを達成し、トランスフォーマー基盤およびCNN基盤のSOTA手法を上回った。
  • アブレーションスタディにより、グレースケール乗数損失を削除すると顕著な性能低下が生じ、色アーチファクトの抑制においてその重要性が示された。
  • DINO-ViT構造的一致性損失を削除すると構造的保持が悪化し、シーン幾何構造の回復におけるその価値が裏付けられた。
  • 不確実性フィードバックネットワークは、アブレーション結果から、持続的な霧領域における除霧性能を顕著に向上させた。このモジュールを削除すると残留霧が生じ、解像度が低下した。
  • MSE損失のみを用いた場合、暗く過剰に処理された出力が得られ、残留霧と詳細の喪失が生じた。これにより、提案された損失設計の必要性が強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。