[论文解读] WaveFuse: A Unified Deep Framework for Image Fusion with Discrete Wavelet Transform
WaveFuse 提出了一种新颖的无监督深度学习框架用于图像融合,该框架将多尺度离散小波变换(DWT)与编码器-解码器网络的特征图相结合。通过在深度特征上应用自适应 DWT 融合规则,该方法增强了细节和结构的保留,在多个图像融合基准测试中实现了最先进性能,同时显著减少了训练数据量和计算成本。
We propose an unsupervised image fusion architecture for multiple application scenarios based on the combination of multi-scale discrete wavelet transform through regional energy and deep learning. To our best knowledge, this is the first time the conventional image fusion method has been combined with deep learning. The useful information of feature maps can be utilized adequately through multi-scale discrete wavelet transform in our proposed method.Compared with other state-of-the-art fusion method, the proposed algorithm exhibits better fusion performance in both subjective and objective evaluation. Moreover, it's worth mentioning that comparable fusion performance trained in COCO dataset can be obtained by training with a much smaller dataset with only hundreds of images chosen randomly from COCO. Hence, the training time is shortened substantially, leading to the improvement of the model's performance both in practicality and training efficiency.
研究动机与目标
- 开发一种统一的、无监督的深度学习框架,用于多场景图像融合,以有效结合传统变换域方法与学习到的特征。
- 解决现有基于深度学习的融合方法依赖于特征简单加权平均以及需要大规模数据集进行训练的局限性。
- 通过利用多尺度离散小波变换,更好地挖掘深度特征图中的结构和纹理信息,从而提升融合性能。
- 证明在极小量训练数据下也可实现高质量的融合结果,从而减少训练时间与计算开销。
提出的方法
- 使用编码器-解码器网络从输入源图像中提取分层深度特征。
- 通过多尺度离散小波变换(DWT)将提取的特征图转换到小波域,以分离低频分量(结构信息)和高频分量(纹理信息)。
- 对低频和高频子带分别应用基于区域能量的自适应融合规则,以保留显著细节和边缘信息。
- 通过逆向 DWT 重建融合后的特征图,以恢复空间一致性,随后解码生成最终的融合图像。
- 整个框架以端到端、无监督的方式进行训练,无需成对的真实融合图像作为监督信号。
- 该方法对小波分解层数和小波基具有鲁棒性,最优性能在 2 层分解和 db1 小波基下实现。
实验结果
研究问题
- RQ1将传统的离散小波变换(DWT)与深度特征图结合,是否能相比标准深度学习融合方法提升图像融合性能?
- RQ2基于 DWT 的融合模块在多大程度上能增强深度特征中结构和纹理细节的表征能力?
- RQ3当在小样本数据集上训练(例如 COCO 数据集的 0.5%)时,所提出的框架能否实现与在大规模数据集上训练相当或更优的性能?
- RQ4在所提出的框架中,不同的小波分解层数和小波基如何影响最终的融合质量?
主要发现
- WaveFuse 在多个图像融合基准测试中达到最先进性能,在多焦点和红外-可见光融合任务中,10项客观指标中的7项排名第一(EN、CE、FMI_pixel、FMI_dct、Q^NICE、Q^AB/F 和 MS-SSIM)。
- 在多焦点图像融合中,WaveFuse 在 FMI_pixel、FMI_dct、FMI_w、Q^NICE 和 Q^AB/F 指标上得分最高,EN、CE、VARI 和 MS-SSIM 指标排名第二。
- 在红外与可见光图像融合中,WaveFuse 在 FMI_dct、FMI_w、Q^NICE 和 Q^AB/F 指标上得分最高,EN、FMI_pixel 和 VARI 指标排名第二。
- 在仅使用 COCO 数据集 0.5%(约 100 张图像)的极小数据集上训练的模型,其融合性能与在完整 COCO 数据集上训练的模型相当,训练时间从 7.78 小时缩短至一小时以内。
- 在极小数据集上训练时,GPU 显存占用仅为 4085 MB,相比完整数据集训练(17345 MB)显著降低了计算成本。
- 消融实验验证了基于 DWT 的融合模块显著提升了性能,最优配置为 2 层分解与 db1 小波基。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。