[論文レビュー] TGFuse: An Infrared and Visible Image Fusion Approach Based on Transformer and Generative Adversarial Network
本稿では、グローバル特徴モデリングに軽量トランスフォーマー・モジュールを組み合わせ、生成的敵対ネットワーク(GANs)を用いて融合品質を向上させる、赤外線および可視画像融合手法TGFuseを提案する。トランスフォーマーに基づく融合モジュールでチャネル間および空間的アテンションを活用し、二重の識別器を用いてモダリティ固有の詳細を保持することで、主観的および客観的評価の両面で最先端の性能を達成し、複数のベンチマーク指標において既存手法を上回る。
The end-to-end image fusion framework has achieved promising performance, with dedicated convolutional networks aggregating the multi-modal local appearance. However, long-range dependencies are directly neglected in existing CNN fusion approaches, impeding balancing the entire image-level perception for complex scenario fusion. In this paper, therefore, we propose an infrared and visible image fusion algorithm based on a lightweight transformer module and adversarial learning. Inspired by the global interaction power, we use the transformer technique to learn the effective global fusion relations. In particular, shallow features extracted by CNN are interacted in the proposed transformer fusion module to refine the fusion relationship within the spatial scope and across channels simultaneously. Besides, adversarial learning is designed in the training process to improve the output discrimination via imposing competitive consistency from the inputs, reflecting the specific characteristics in infrared and visible images. The experimental performance demonstrates the effectiveness of the proposed modules, with superior improvement against the state-of-the-art, generalising a novel paradigm via transformer and adversarial learning in the fusion task.
研究の動機と目的
- 赤外線および可視画像融合におけるCNNベース手法の長距離空間的およびチャネルワイド依存関係を捉える能力の制限に対処すること。
- マルチモodal画像融合に特化した軽量トランスフォーマー・モジュールを用いてグローバルコンテキストモデリングを統合することで、融合品質を向上させること。
- モダリティ固有の特徴を保持する敵対的学習を組み込むことで、融合画像の判別的品質を向上させること。
- トランスフォーマーとGANの長所を統合した、教師なし画像融合タスク向けの新規エンドツーエンド融合フレームワークを確立すること。
- 包括的なアブレーションスタディおよびベンチマーク比較を通じて、提案アーキテクチャの有効性を検証すること。
提案手法
- チャネル・トークン・トランスフォーマーを導入し、特徴マップ内のチャネル間関係をモデリングすることで、空間的およびチャネルワイドな統合学習を可能にする。
- 画像全体の長距離空間的依存関係を捉えるために、空間的トランスフォーマー・モジュールを設計し、グローバルな融合表現を向上させる。
- 合成トランスフォーマー融合モジュールは、空間的およびチャネルワイド・アテンションを組み合わせ、モダリティ固有の特徴間の特徴相互作用を精緻化する。
- 敵対的学習として、二重の識別器を用いる:一つは赤外線画像と融合画像を比較し、もう一つは可視画像と融合画像を比較することで、入力モダリティの特徴に忠実な融合を促進する。
- 初期特徴抽出には、残差ブロックを用いた軽量エンコーダ・デコーダ・ネットワークを採用し、その後にトランスフォーマー融合モジュールを適用する。
- アブレーションスタディで性能低下が見られたことから、トランスフォーマーで位置埋め込みを省略することで、インダクティブバイアスを低減する。
実験結果
リサーチクエスチョン
- RQ1軽量トランスフォーマー・モジュールは、赤外線および可視画像融合において、長距離空間的およびチャネルワイド依存関係を効果的にモデリングできるか?
- RQ2教師なし設定下で、敵対的学習は融合画像の知覚的品質およびモダリティ忠実度をどのように向上させるか?
- RQ3画像融合性能の最適なトランスフォーマー層数、CNNの深さ、特徴チャネル数の設定は何か?
- RQ4本タスクにおいて、トランスフォーマーから位置埋め込みを削除することは、融合性能を向上させるか、悪化させるか?
- RQ5個々のモジュール(空間的、チャネル、敵対的モジュール)は、アブレーション変種と比較して、全体の融合品質にどのように寄与しているか?
主な発見
- 提案されたTGFuse手法は、最先端の手法と比較して、あらゆる客観的評価指標で優れた性能を達成し、複数のベンチマークで一貫した改善を示した。
- アブレーションスタディの結果、チャネルトランスフォーマーを先に、その後に空間トランスフォーマーを適用する順序(チャネル→空間)が、個別または逆順の構成を上回る最良の融合結果をもたらした。
- トランスフォーマーモジュールから位置埋め込みを削除すると性能が向上したため、本タスクでは位置バイアスが有益でないことが示された。
- 最適なトランスフォーマー・エンコーダ層数は4層であり、3層では意味のある融合関係を学習できないのに対し、5層以上では冗長性が生じて性能が低下した。
- CNNの深さとして4つの残差ブロックが最良の特徴表現をもたらした。これより深いネットワークでは、過剰なダウンサンプリングにより意味のない黒い出力が生じた。
- アブレーションで決定された最適な特徴チャネル数は64であり、他の値では評価指標上で劣悪な性能が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。