Skip to main content
QUICK REVIEW

[论文解读] A Symmetric Encoder-Decoder with Residual Block for Infrared and Visible Image Fusion

Lihua Jian, Xiaomin Yang|arXiv (Cornell University)|May 27, 2019
Advanced Image Fusion Techniques参考文献 40被引用 12
一句话总结

本文提出 SEDRFuse,一种用于红外与可见光图像融合的对称编码器-解码器网络,采用残差块结构,结合中间特征提取、注意力图与补偿特征,以提升细节保留与融合质量。该方法在主观与客观评估中均达到最先进性能,在融合精度与速度方面优于现有方法。

ABSTRACT

In computer vision and image processing tasks, image fusion has evolved into an attractive research field. However, recent existing image fusion methods are mostly built on pixel-level operations, which may produce unacceptable artifacts and are time-consuming. In this paper, a symmetric encoder-decoder with a residual block (SEDR) for infrared and visible image fusion is proposed. For the training stage, the SEDR network is trained with a new dataset to obtain a fixed feature extractor. For the fusion stage, first, the trained model is utilized to extract the intermediate features and compensation features of two source images. Then, extracted intermediate features are used to generate two attention maps, which are multiplied to the input features for refinement. In addition, the compensation features generated by the first two convolutional layers are merged and passed to the corresponding deconvolutional layers. At last, the refined features are fused for decoding to reconstruct the final fused image. Experimental results demonstrate that the proposed fusion method (named as SEDRFuse) outperforms the state-of-the-art fusion methods in terms of both subjective and objective evaluations.

研究动机与目标

  • 为解决像素级图像融合方法因输入未配准而导致速度慢、易产生伪影的局限性。
  • 开发一种特征级融合框架,在降低计算成本的同时,保留红外与可见光图像中的关键结构与纹理细节。
  • 设计一种具有残差块的对称编码器-解码器架构,以稳定训练过程并提升特征表示能力。
  • 探究注意力图与补偿特征在优化融合输出方面的有效性,以实现更优的视觉与量化性能。

提出的方法

  • 在自定义数据集上训练一个具有残差块的对称编码器-解码器网络(SEDR),作为红外与可见光图像的固定特征提取器。
  • 利用编码器的中间特征生成两个注意力图,并通过逐元素相乘的方式对输入特征进行优化。
  • 将前两层卷积层的补偿特征进行融合,并传递至对应的反卷积层,以减轻下采样过程中的细节损失。
  • 分别对融合后的中间特征与融合后的补偿特征进行解码,并合并生成最终的融合图像。
  • 采用损失函数最小化输入与输出之间的差异,以确保特征学习的代表性与稳定性。
  • 该框架可直接扩展至其他多模态图像融合任务(如多焦点、医学、多曝光图像融合),无需微调,展现出良好的泛化能力。

实验结果

研究问题

  • RQ1具有残差块的对称编码器-解码器能否有效提取并融合红外与可见光图像中的互补特征?
  • RQ2基于中间特征生成的注意力图相较于标准融合策略,如何提升融合图像的质量?
  • RQ3来自早期卷积层的补偿特征在多大程度上可减少下采样过程中的细节损失?
  • RQ4在自定义红外-可见光图像对数据集(FLIR 与 KAIST)上进行训练,是否比使用通用数据集(如 MSCOCO)能获得更优的融合性能?
  • RQ5所提出的 SEDRFuse 框架是否能泛化至红外-可见光融合以外的其他多模态图像融合任务?

主要发现

  • 在 TNO 与 FLIR 数据集上,SEDRFuse 方法在客观指标上均优于最先进方法,其中在 TNO 数据集上达到 0.7219 的 SSIM 与 0.5511 的 VIF。
  • 该方法每对图像的平均融合时间为 1.635 秒,显著快于 CNN(86.069 秒)与 FusionGAN(1.637 秒)。
  • 在自定义红外-可见光数据集(FLIR 与 KAIST)上训练,相比使用 MSCOCO 数据集,SSIM 提升 0.0305,VIF 提升 0.0680。
  • 注意力图与补偿特征的使用使融合图像更具自然感与细节表现,多组数据集的视觉对比结果验证了这一点。
  • 该框架在多焦点、医学(CT-MRI)及多曝光图像融合任务中均表现出良好泛化能力,无需微调即可生成视觉一致且信息丰富的融合输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。