Skip to main content
QUICK REVIEW

[論文レビュー] A Dual-branch Network for Infrared and Visible Image Fusion

Yu Fu, Xiao‐Jun Wu|arXiv (Cornell University)|Jan 24, 2021
Advanced Image Fusion Techniques参考文献 32被引用数 7
ひとこと要約

本稿では、赤外線と可視光画像の融合のための二重ブランチ自己符号化器ネットワークを提案する。詳細ブランチは密接接続を用い、意味的ブランチは高速なダウンサンプリングを用いて補完的特徴を抽出し、チャネル別戦略により融合され、デコーダーによって再構築される。本手法はベンチマークデータセットで最先端の性能を達成し、構造的類似性、エッジ保持、ノイズ低減の面で既存手法を上回る。

ABSTRACT

Deep learning is a rapidly developing approach in the field of infrared and visible image fusion. In this context, the use of dense blocks in deep networks significantly improves the utilization of shallow information, and the combination of the Generative Adversarial Network (GAN) also improves the fusion performance of two source images. We propose a new method based on dense blocks and GANs , and we directly insert the input image-visible light image in each layer of the entire network. We use SSIM and gradient loss functions that are more consistent with perception instead of mean square error loss. After the adversarial training between the generator and the discriminator, we show that a trained end-to-end fusion network -- the generator network -- is finally obtained. Our experiments show that the fused images obtained by our approach achieve good score based on multiple evaluation indicators. Further, our fused images have better visual effects in multiple sets of contrasts, which are more satisfying to human visual perception.

研究の動機と目的

  • 異なる信号源からの補完的情報を活用することにより、赤外線と可視光画像の融合の課題に取り組む。
  • 二重ブランチエンコーダーを設計することで、詳細な特徴と意味的特徴を別々に捉えることで、特徴抽出を向上させる。
  • 情報量の多い特徴チャネルを優先する新しい損失関数とチャネルベースの融合戦略を通じて、融合性能を向上させる。
  • 主観的および客観的画像融合評価指標の両面で最先端の結果を達成する。
  • 赤外線・可視光融合にとどまらず、医療画像や高スペクトル画像処理などに応用可能な汎用的なフレームワークを提供する。

提案手法

  • ネットワークは自己符号化器アーキテクチャを採用し、二重ブランチエンコーダーを備える:一方のブランチは密接接続を用いて浅いエッジ豊富な詳細特徴を抽出し、他方のブランチはストライド付き畳み込みを用いてグローバルな意味的および構造的表現を取得する。
  • 赤外線および可視光画像は、二重ブランチ構造を独立して用いて、それぞれ2つの特徴マップのセットを生成する。
  • 融合層は、2つの特徴マップのセットを連結し、学習可能なチャネル別アテンション機構を適用して重要なチャネルを強調することで、それらを統合する。
  • 融合された特徴は、トランスポジット畳み込みとスキップ接続を用いて再構築されるデコーダーを通過し、最終的な融合画像が得られる。
  • 再構築誤差を最小化し、主観的品質を向上させるために、L1損失と特徴損失を組み合わせた新しい損失関数を設計する。
  • ピxls単位の再構築損失と特徴損失の組み合わせを用いて、エンド・トゥ・エンドでネットワークを学習させ、構造的およびテクスチャ的忠実度を保持する。
Figure 1: The backbone of our network in this paper. The orange blocks is the detail branch, and the green blocks is the semantic branch. Concatenate the encoding results of the two branches to get our latent layer.
Figure 1: The backbone of our network in this paper. The orange blocks is the detail branch, and the green blocks is the semantic branch. Concatenate the encoding results of the two branches to get our latent layer.

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、赤外線と可視光画像からどのように補完的特徴を効果的に抽出・融合できるか?
  • RQ2どのようなネットワークアーキテクチャが、融合画像における微細なディテールとグローバル構造の両方をよりよく保持できるか?
  • RQ3チャネル別融合戦略は、マルチスペクトル画像融合において従来の要素ごとの融合手法を上回ることができるか?
  • RQ4提案された損失関数は、再構築品質の向上とアーチファクトの低減にどの程度寄与するか?
  • RQ5本手法は、赤外線・可視光融合にとどまらず、他の画像融合タスクにも一般化可能か?

主な発見

  • 提案手法は、EI、SF、EN、SSIM、Nabf、MIの6つの客観的指標において、最良または第2位の性能を達成し、優れた融合品質を示した。
  • チャネルベースの融合戦略は、EI(59.2286)とSF(21.9070)で最高を記録し、エッジおよびコントラストの保持が優れていることを示した。
  • 加算戦略は、SSIM(0.7593)で最高で、Nabf(0.0010)で最低を記録し、高い構造的類似性と最小限のノイズを示した。
  • 主観的評価では、CBF、FusionGan、DenseFuseとは異なり、本手法はアーチファクトやノイズを導入せず、より多くのテクスチャディテールと熱放射情報が保持されていた。
  • 定量的指標および視覚的品質の両面で、DenseFuse、FusionGan、DeepFuseといった最先端モデルを上回った。
  • ネットワーク構造と損失関数は汎用的であり、医療画像処理、高スペクトル融合、その他の画像再構築タスクへの応用が期待できる。
Figure 2: The network during the test phase.
Figure 2: The network during the test phase.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。