[论文解读] A Dual-branch Network for Infrared and Visible Image Fusion
本文提出一种用于红外与可见光图像融合的双分支自编码器网络,通过具有密集连接的细节分支和具有快速下采样的语义分支提取互补特征,采用通道注意力策略进行特征融合,并通过解码器重建图像。该方法在基准数据集上实现了最先进性能,在结构相似性、边缘保持和噪声抑制方面优于现有方法。
Deep learning is a rapidly developing approach in the field of infrared and visible image fusion. In this context, the use of dense blocks in deep networks significantly improves the utilization of shallow information, and the combination of the Generative Adversarial Network (GAN) also improves the fusion performance of two source images. We propose a new method based on dense blocks and GANs , and we directly insert the input image-visible light image in each layer of the entire network. We use SSIM and gradient loss functions that are more consistent with perception instead of mean square error loss. After the adversarial training between the generator and the discriminator, we show that a trained end-to-end fusion network -- the generator network -- is finally obtained. Our experiments show that the fused images obtained by our approach achieve good score based on multiple evaluation indicators. Further, our fused images have better visual effects in multiple sets of contrasts, which are more satisfying to human visual perception.
研究动机与目标
- 为解决利用不同信号源的互补信息融合红外与可见光图像的挑战。
- 通过设计双分支编码器分别捕获细节与语义特征,提升特征提取能力。
- 通过新型损失函数和基于通道的融合策略,优先关注信息量丰富的特征通道,从而提升融合性能。
- 在主观与客观图像融合评估指标上均达到最先进水平。
- 提供一种可泛化的框架,适用于红外-可见光融合之外的应用,包括医学成像与高光谱成像。
提出的方法
- 网络采用自编码器架构,配备双分支编码器:一个分支利用密集连接提取浅层、富含边缘的细节;另一个分支利用步幅卷积实现全局语义与结构表征。
- 红外与可见光图像通过双分支结构独立编码,生成两组特征图。
- 融合层通过拼接两组特征并应用可学习的通道注意力机制,突出重要通道。
- 融合后的特征经解码器通过转置卷积与跳跃连接重建最终融合图像。
- 设计了一种新型损失函数,以最小化重建误差并提升感知质量,结合L1损失与感知损失分量。
- 通过像素级重建损失与感知损失的组合,实现端到端训练,以保持结构与纹理保真度。

实验结果
研究问题
- RQ1如何通过深度神经网络有效提取并融合红外与可见光图像中的互补特征?
- RQ2何种网络架构能更好地在融合图像中保留精细细节与全局结构?
- RQ3基于通道的融合策略是否能在多光谱图像融合中超越传统的逐元素融合方法?
- RQ4所提出的损失函数在多大程度上提升了重建质量并减少了伪影?
- RQ5所提出方法在红外-可见光融合之外的其他图像融合任务中是否具备泛化能力?
主要发现
- 所提方法在六项客观指标(EI、SF、EN、SSIM、Nabf、MI)中均达到最佳或第二佳表现,证明了其卓越的融合质量。
- 基于通道的融合策略在EI(59.2286)与SF(21.9070)上表现最优,表明其具有优异的边缘与对比度保持能力。
- 加法融合策略在SSIM(0.7593)上表现最佳,Nabf(0.0010)最低,表明结构相似性高且噪声最少。
- 主观评估显示,所提方法在不引入伪影或噪声的前提下,保留了更多纹理细节与热辐射信息,而CBF、FusionGan与DenseFuse则存在此类问题。
- 在定量指标与视觉质量方面,该方法均优于DenseFuse、FusionGan与DeepFuse等最先进模型。
- 网络结构与损失函数具备可泛化性,潜在适用于医学成像、高光谱融合及其他图像重建任务。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。