Skip to main content
QUICK REVIEW

[論文レビュー] Efficient and Model-Based Infrared and Visible Image Fusion Via Algorithm Unrolling

Zixiang Zhao, Shuang Xu|arXiv (Cornell University)|May 12, 2020
Advanced Image Fusion Techniques参考文献 51被引用数 6
ひとこと要約

本稿では、アルゴリズムアンローリングを用いたモデルベースの深層学習フレームワーク、AUIFを提案する。反復的最適化モデルを、ベース特徴量と詳細特徴量のための別個のエンコーダと共有デコーダを持つトレーニング可能なCNNにアンロールすることで、AUIFはわずか11.63kのパラメータで、TNOで平均2.98秒の高速推論を実現し、定量的・定性的な指標において既存手法を上回る最先端の融合性能を達成した。

ABSTRACT

Infrared and visible image fusion (IVIF) expects to obtain images that retain thermal radiation information from infrared images and texture details from visible images. In this paper, a model-based convolutional neural network (CNN) model, referred to as Algorithm Unrolling Image Fusion (AUIF), is proposed to overcome the shortcomings of traditional CNN-based IVIF models. The proposed AUIF model starts with the iterative formulas of two traditional optimization models, which are established to accomplish two-scale decomposition, i.e., separating low-frequency base information and high-frequency detail information from source images. Then the algorithm unrolling is implemented where each iteration is mapped to a CNN layer and each optimization model is transformed into a trainable neural network. Compared with the general network architectures, the proposed framework combines the model-based prior information and is designed more reasonably. After the unrolling operation, our model contains two decomposers (encoders) and an additional reconstructor (decoder). In the training phase, this network is trained to reconstruct the input image. While in the test phase, the base (or detail) decomposed feature maps of infrared/visible images are merged respectively by an extra fusion layer, and then the decoder outputs the fusion image. Qualitative and quantitative comparisons demonstrate the superiority of our model, which can robustly generate fusion images containing highlight targets and legible details, exceeding the state-of-the-art methods. Furthermore, our network has fewer weights and faster speed.

研究の動機と目的

  • データ駆動型CNNの赤外線および可視光画像融合(IVIF)における限界、特に解釈可能性の欠如と経験的アーキテクチャ設計依存の問題を解決すること。
  • 従来の最適化モデルから得られるモデルベースの事前知識を深層学習フレームワークに統合し、解釈可能性と性能の両方を向上させること。
  • 熱放射と空間的詳細を保持する、軽量で効率的かつ頑健なIVIF手法を開発すること。
  • ネットワークの複雑さと推論時間を低減しながら、融合品質を維持または向上させること。

提案手法

  • まず、二つのスケール分解のための従来の最適化モデルを用意する:低周波数のベース特徴量用と高周波数の詳細特徴量用。
  • アルゴリズムアンローリングを適用し、各最適化反復をトレーニング可能なCNN層に変換することで、全体のモデルを微分可能なニューラルネットワークに変換する。
  • ネットワークアーキテクチャは、ベース特徴量と詳細特徴量のための二つのエンコーダと共有デコーダから構成され、元の最適化モデルから導出されたトレーニング可能な係数を有する。
  • 学習段階では、入力画像を正確に再構成するために、ℓ₂とSSIMの損失関数の組み合わせを用いてネットワークを最適化する。
  • 推論段階では、赤外線および可視光画像からのベース特徴マップと詳細特徴マップが、デコーダによる再構成の前に学習可能な統合層を介して別々に統合される。
  • 層の数(反復回数)と統合戦略は、ベンチマークデータセットでの検証により決定される。

実験結果

リサーチクエスチョン

  • RQ1アルゴリズムアンローリングは、IVIFにおける従来のモデルベース最適化と深層学習を効果的に橋渡しできるか?
  • RQ2CNNアーキテクチャにモデル事前知識を統合することで、融合性能と効率性が向上するか?
  • RQ3少ないパラメータ数で実現する軽量ネットワークが、既存の深層学習ベースのIVIF手法を上回ることができるか?
  • RQ4提案手法は、ずれのある画像や低照度画像に対しても適応可能か?

主な発見

  • AUIFはTNO、FLIR、NIRデータセットで一貫して最先端の性能を達成し、定性的および定量的評価の両方で既存手法を上回った。
  • TNOデータセットにおける平均推論時間は2.98秒であり、CSR(2119.32秒) や ImageFuse(149.83秒)といった多くのベースラインと比べて顕著に高速であった。
  • 学習可能なパラメータ数がわずか11.63kであるため、DenseFuse(74.19k) や FusionGan(925.63k)と比べて顕著にパラメータ効率が高かった。
  • 低照度や画像のずれといった困難な条件下でも、明確なターゲットの強調と識別可能な詳細を有する融合画像を生成した。
  • アブレーションスタディにより、別個のエンコーダの使用や統合層戦略の妥当性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。