Skip to main content
QUICK REVIEW

[論文レビュー] Infrared and Visible Image Fusion via Interactive Compensatory Attention Adversarial Learning

Zhishe Wang, Wenyu Shao|arXiv (Cornell University)|Mar 29, 2022
Advanced Image Fusion Techniques被引用数 5
ひとこと要約

本稿では、赤外線と可視光画像の融合のための新規エンドツーエンド生成的対抗ネットワーク、ICAFusionを提案する。本手法は、長距離依存関係をモデル化し特徴表現を強化するため、インタラクティブで補償的なアテンションモジュールを備えた三路径エンコーダ・デコーダアーキテクチャを採用する。二重判別器と特化した損失関数を統合することで、融合バランスが向上し、赤外線ターゲットの詳細と可視テクスチャを良好に保持する。複数のデータセットにおいて、主観的および客観的評価の両面で、9つの最先端手法を上回る性能を達成した。

ABSTRACT

The existing generative adversarial fusion methods generally concatenate source images and extract local features through convolution operation, without considering their global characteristics, which tends to produce an unbalanced result and is biased towards the infrared image or visible image. Toward this end, we propose a novel end-to-end mode based on generative adversarial training to achieve better fusion balance, termed as extit{interactive compensatory attention fusion network} (ICAFusion). In particular, in the generator, we construct a multi-level encoder-decoder network with a triple path, and adopt infrared and visible paths to provide additional intensity and gradient information. Moreover, we develop interactive and compensatory attention modules to communicate their pathwise information, and model their long-range dependencies to generate attention maps, which can more focus on infrared target perception and visible detail characterization, and further increase the representation power for feature extraction and feature reconstruction. In addition, dual discriminators are designed to identify the similar distribution between fused result and source images, and the generator is optimized to produce a more balanced result. Extensive experiments illustrate that our ICAFusion obtains superior fusion performance and better generalization ability, which precedes other advanced methods in the subjective visual description and objective metric evaluation. Our codes will be public at \url{https://github.com/Zhishe-Wang/ICAFusion}

研究の動機と目的

  • 従来のGANベース手法が入力を連結し単一の判別器に依存するため生じる融合結果のアンバランスを是正すること。
  • マルチパスエンコーダ・デコーダフレームワーク内でインタラクティブで補償的なアテンション機構を用いて長距離依存関係をモデル化し、特徴表現を向上させること。
  • 融合結果と入力画像間の分布類似性を強制する二重判別器を用いることで、より良い融合バランスを達成すること。
  • 赤外線および可視光パスを別々に設計し、強度と勾配情報の提供により、ターゲット認識とテクスチャ保持の性能を向上させること。
  • 多様なベンチマークデータセットにわたる強力な汎化能力と計算効率を実証すること。

提案手法

  • 赤外線および可視光画像のモodal特徴を保持するため、一つのメインパスと二つの補助パス(赤外線および可視光用)を備えたマルチレベルエンコーダ・デコーダネットワーク。
  • パス間で特徴マップを交換・精錬することで、長距離依存関係をモデル化し表現力の向上を図るインタラクティブで補償的なアテンションモジュール。
  • 融合結果と入力画像間の類似性を評価する二重判別器が、生成器がよりバランス良く現実的な出力を生成するように導く。
  • 敵対的損失、再構成損失、アテンションベース損失を組み合わせた特定の損失関数により、生成器の融合品質を最適化する。
  • 敵対的学習を用いたエンドツーエンド学習により、特徴抽出、アテンション調整、融合生成を同時に最適化する。
  • 赤外線および可視光パスから得られる強度と勾配情報を統合し、ターゲットおよび詳細の保持を強化する。

実験結果

リサーチクエスチョン

  • RQ1インタラクティブで補償的なアテンション機構は、赤外線・可視光画像融合における特徴表現と融合バランスを向上させ得るか?
  • RQ2単一判別器GANと比較して、二重判別器を用いることで、融合結果と入力画像間の分布類似性が向上するか?
  • RQ3モダリティ固有のパスを備えた三路径エンコーダ・デコーダアーキテクチャは、ターゲットおよびテクスチャ詳細の保持を向上させ得るか?
  • RQ4主観的視覚品質および客観的指標の両面で、ICAFusionは最先端手法と比較してどのように性能を発揮するか?
  • RQ5ICAFusionは多様なデータセットにわたって、計算効率と汎化能力に優れているか?

主な発見

  • TNOデータセットにおいて、ICAFusionはEN、SD、MI、NCIE、VIFの5つの客観的指標で1位を達成し、AGおよびSFでは2位を記録した。
  • Roadsceneデータセットでは、EN、SD、MI、NCIE、VIFで1位、AG、SF、Qabfで2位を達成し、IFCNNを除くすべての手法を上回った。
  • OTCBVSデータセットでは、EN、SD、MI、NCIE、VIFで1位、AG、SF、Qabfで2位を記録し、多様なシーンにわたる強力な汎化能力を示した。
  • 最高のEN値は、三路径構造とアテンション機構のおかげで、入力画像からの有用な情報が豊富に保持されていることを示している。
  • 最大のMIおよびNCIE値は、二重判別器の監視と最適化された損失関数のおかげで、融合結果と入力画像との間の強い相関性と類似性が確認されたことを裏付けている。
  • ICAFusionは競争的な計算効率を達成しており、DenseFuseやIFCNNにわずかに劣るが、CPUで動作するMDLatLRRに比べて顕著に高速であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。