Skip to main content
QUICK REVIEW

[論文レビュー] Mutual Information-driven Triple Interaction Network for Efficient Image Dehazing

Hao Shen, Zhong‐Qiu Zhao|arXiv (Cornell University)|Aug 14, 2023
Image Enhancement TechniquesComputer Science被引用数 3
ひとこと要約

本稿では、空間周波数二重ドメインの事前知識を活用し、まず振幅スペクトルを復元してはだを除去し、次に位相スペクトルを精緻化することで構造的強化を図る、相互情報量駆動型の二段階型除霧ネットワークであるMITNetを提案する。本手法は、コンテンツに適応したフィルタを用いることで、ドメイン間(空間/周波数)、スケール間、段階間の特徴量統合を実現するためのアダプティブな三重相互作用モジュール(ATIM)を導入し、冗長性を低減するための相互情報量最小化を適用することで、公的ベンチマークで最先端の性能を達成しながらも、より低い複雑性を実現した。

ABSTRACT

Multi-stage architectures have exhibited efficacy in image dehazing, which usually decomposes a challenging task into multiple more tractable sub-tasks and progressively estimates latent hazy-free images. Despite the remarkable progress, existing methods still suffer from the following shortcomings: (1) limited exploration of frequency domain information; (2) insufficient information interaction; (3) severe feature redundancy. To remedy these issues, we propose a novel Mutual Information-driven Triple interaction Network (MITNet) based on spatial-frequency dual domain information and two-stage architecture. To be specific, the first stage, named amplitude-guided haze removal, aims to recover the amplitude spectrum of the hazy images for haze removal. And the second stage, named phase-guided structure refined, devotes to learning the transformation and refinement of the phase spectrum. To facilitate the information exchange between two stages, an Adaptive Triple Interaction Module (ATIM) is developed to simultaneously aggregate cross-domain, cross-scale, and cross-stage features, where the fused features are further used to generate content-adaptive dynamic filters so that applying them to enhance global context representation. In addition, we impose the mutual information minimization constraint on paired scale encoder and decoder features from both stages. Such an operation can effectively reduce information redundancy and enhance cross-stage feature complementarity. Extensive experiments on multiple public datasets exhibit that our MITNet performs superior performance with lower model complexity.The code and models are available at https://github.com/it-hao/MITNet.

研究の動機と目的

  • 既存の画像除霧手法における周波数ドメイン情報の活用が限定的であることを是正すること。
  • 多段階除霧アーキテクチャにおける段階間およびスケール間の特徴量相互作用を向上させること。
  • 段階間における明示的な補完的学習を通じて特徴冗長性を低減すること。
  • アダプティブかつ文脈に適応した特徴調制を用いて表現能力を向上させること。
  • より低いモデル複雑性で最先端の性能を達成すること。

提案手法

  • ネットワークは二段階設計を採用する。第一段階では、はだ画像の振幅スペクトルを復元してはだ除去を行い、第二段階では位相スペクトルを精緻化することで構造的強化を図る。
  • アダプティブ三重相互作用モジュール(ATIM)は、ドメイン(空間/周波数)、スケール、段階を横断して特徴量を統合し、コンテンツに適応した動的フィルタを生成する。
  • これらの動的フィルタはデコーダ特徴に適用され、アダプティブ特徴調制によってグローバルな文脈表現を強化する。
  • 両段階からのペairedエンコーダ・デコーダ特徴量に相互情報量制約(MIC)を課し、冗長性を低減し、補完的学習を促進する。
  • 周波数ドメインの事前知識(振幅ははだ除去、位相は構造精緻化)を統合的かつ段階的なフレームワークに統合する。
  • MICは推論時に適用されないため、推論のオーバーヘッドを回避し、パラメータを増加させることなく効率性を確保する。

実験結果

リサーチクエスチョン

  • RQ1はだ除去を振幅スペクトルと位相スペクトルの復元に分離することで、除霧性能が向上するか?
  • RQ2空間/周波数ドメイン間、スケール間、段階間の特徴量を効果的に統合するにはどうすればよいか?
  • RQ3多段階特徴量相互作用から生成されるアダプティブかつコンテンツに適応したフィルタは、特徴量の精緻化を向上させるか?
  • RQ4段階間特徴量間の相互情報量最小化は、冗長性を低減し、特徴量の補完性を向上させるか?
  • RQ5二段階型・二重ドメインアーキテクチャは、より低いモデル複雑性でSOTA結果を達成できるか?

主な発見

  • MITNetはベンチマークデータセットで40 dBを超えるPSNRを達成した。これは、同種のモデルで初めての成果であり、最先端の性能を示している。
  • アブレーションスタディでは、ATIMとMICを併用した場合、ベースラインと比較して1.77 dBのPSNR向上が確認され、両者の有効性が裏付けられた。
  • ATIMやMICを除去すると、結果に明確なテクスチャおよびコントラストのずれが生じ、特徴量品質におけるその重要性が示された。
  • 可視化により、MICは特徴マップの重複を減らし、より補完的であることを示しており、特徴冗長性が低減していることが確認された。
  • モデルは低複雑性と高速な推論を維持しており、MICは推論時にパラメータや計算コストを追加しない。
  • ヒストограмと特徴可視化の結果、MITNetは照度、色収差、テクスチャ分布の面でクリアな画像に近い出力を生成していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。