[论文解读] Infrared and Visible Image Fusion via Interactive Compensatory Attention Adversarial Learning
本文提出 ICAFusion,一种新颖的端到端生成对抗网络,用于红外与可见光图像融合。该方法采用三路径编码器-解码器架构,并结合交互式与补偿注意力模块,以建模长距离依赖关系并增强特征表示。通过集成双判别器和专用损失函数,该方法在融合平衡性方面表现优异,有效保留了红外目标细节与可见光纹理,在多个数据集上的主观与客观评估中均优于九种最先进方法。
The existing generative adversarial fusion methods generally concatenate source images and extract local features through convolution operation, without considering their global characteristics, which tends to produce an unbalanced result and is biased towards the infrared image or visible image. Toward this end, we propose a novel end-to-end mode based on generative adversarial training to achieve better fusion balance, termed as extit{interactive compensatory attention fusion network} (ICAFusion). In particular, in the generator, we construct a multi-level encoder-decoder network with a triple path, and adopt infrared and visible paths to provide additional intensity and gradient information. Moreover, we develop interactive and compensatory attention modules to communicate their pathwise information, and model their long-range dependencies to generate attention maps, which can more focus on infrared target perception and visible detail characterization, and further increase the representation power for feature extraction and feature reconstruction. In addition, dual discriminators are designed to identify the similar distribution between fused result and source images, and the generator is optimized to produce a more balanced result. Extensive experiments illustrate that our ICAFusion obtains superior fusion performance and better generalization ability, which precedes other advanced methods in the subjective visual description and objective metric evaluation. Our codes will be public at \url{https://github.com/Zhishe-Wang/ICAFusion}
研究动机与目标
- 解决传统基于 GAN 的方法因输入拼接和依赖单个判别器而导致的融合结果失衡问题。
- 通过在多路径编码器-解码器框架中引入交互式与补偿注意力机制,建模长距离依赖关系,以提升特征表示能力。
- 通过双判别器强制融合结果与源图像之间的分布相似性,实现更优的融合平衡性。
- 通过为红外与可见光路径分别设计的专用路径,提供强度与梯度信息,以增强目标感知与纹理保留能力。
- 在多样化基准数据集上展示强大的泛化能力与计算效率。
提出的方法
- 具有三路径结构的多级编码器-解码器网络:一条主路径与两条辅助路径,分别用于红外与可见光图像,以保留模态特异性特征。
- 交互式与补偿注意力模块在不同路径间交换并优化特征图,以建模长距离依赖关系并提升表示能力。
- 双判别器用于评估融合结果与源图像之间的相似性,引导生成器输出更均衡、更真实的图像。
- 采用结合对抗损失、重建损失与注意力损失的专用损失函数,以优化生成器,提升融合质量。
- 端到端训练,结合对抗学习,联合优化特征提取、注意力调制与融合生成过程。
- 在红外与可见光路径中引入强度与梯度信息,以增强目标与细节的保留能力。
实验结果
研究问题
- RQ1交互式与补偿注意力机制是否能提升红外-可见光图像融合中的特征表示与融合平衡性?
- RQ2与单判别器 GAN 相比,使用双判别器是否能实现更优的融合结果与源图像之间的分布对齐?
- RQ3具有模态特异性路径的三路径编码器-解码器架构是否能增强目标与纹理细节的保留?
- RQ4在主观视觉质量与客观指标方面,ICAFusion 相较于最先进方法的表现如何?
- RQ5ICAFusion 在多样化数据集上的计算效率与泛化能力如何?
主要发现
- 在 TNO 数据集上,ICAFusion 在五项客观指标(EN、SD、MI、NCIE 和 VIF)中排名第一,AG 与 SF 指标排名第二。
- 在 Roadscene 数据集上,ICAFusion 在 EN、SD、MI、NCIE 和 VIF 指标中排名第一,AG、SF 与 Qabf 指标排名第二,仅略逊于 IFCNN,优于所有其他方法。
- 在 OTCBVS 数据集上,ICAFusion 在 EN、SD、MI、NCIE 和 VIF 指标中排名第一,AG、SF 与 Qabf 指标排名第二,展现出在多样化场景中的强大泛化能力。
- 最高的 EN 值表明 ICAFusion 有效保留了源图像中的丰富有用信息,归因于三路径设计与注意力机制。
- 最大的 MI 与 NCIE 值证实了融合结果与源图像之间具有强相关性与相似性,得益于双判别器监督与优化的损失函数。
- ICAFusion 实现了具有竞争力的计算效率,仅略慢于 DenseFuse 与 IFCNN,但显著快于运行在 CPU 上的 MDLatLRR。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。