[论文解读] SESF-Fuse: An Unsupervised Deep Model for Multi-Focus Image Fusion
本文提出 SESF-Fuse,一种用于多焦点图像融合的无监督深度学习模型,通过自编码器提取的深度特征与空间频率结合,衡量图像区域的活动水平并生成融合决策图。该方法聚焦于特征梯度而非亮度,无需合成训练数据,在客观指标和主观评价中均达到最先进性能,优于16种现有方法。
In this work, we propose a novel unsupervised deep learning model to address multi-focus image fusion problem. First, we train an encoder-decoder network in unsupervised manner to acquire deep feature of input images. And then we utilize these features and spatial frequency to measure activity level and decision map. Finally, we apply some consistency verification methods to adjust the decision map and draw out fused result. The key point behind of proposed method is that only the objects within the depth-of-field (DOF) have sharp appearance in the photograph while other objects are likely to be blurred. In contrast to previous works, our method analyzes sharp appearance in deep feature instead of original image. Experimental results demonstrate that the proposed method achieves the state-of-art fusion performance compared to existing 16 fusion methods in objective and subjective assessment.
研究动机与目标
- 解决因景深有限导致场景仅部分区域清晰的多焦点图像融合挑战。
- 开发一种无监督深度学习方法,避免对合成训练数据或有监督标注的依赖。
- 通过聚焦于深度特征中的锐利外观而非亮度或原始图像梯度,提升融合性能。
- 将无监督表征学习与传统图像处理技术(如空间频率)结合,实现鲁棒的活动水平估计。
- 在客观指标与视觉质量方面,相比现有方法,实现更优的融合效果。
提出的方法
- 训练一个无监督的编码器-解码器网络,从输入的多焦点图像中提取高层深度特征。
- 结合深度特征与空间频率,计算图像区域的活动水平,突出锐利程度。
- 基于综合活动水平生成决策图,以确定从源图像中选择哪些像素用于融合输出。
- 应用一致性验证方法优化决策图,减少伪影。
- 利用优化后的决策图与原始源图像像素重建最终融合图像。
- 该方法基于假设:仅在景深范围内的物体才表现出锐利外观,此特征通过深度特征梯度捕捉。
实验结果
研究问题
- RQ1无监督深度学习模型能否在无需合成训练数据或有监督标注的情况下,有效融合多焦点图像?
- RQ2使用深度特征与空间频率测量活动水平,是否在多焦点融合中优于基于亮度或梯度的方法?
- RQ3在客观指标与视觉质量方面,该方法与现有最先进融合技术相比表现如何?
- RQ4无监督表征学习与传统图像处理技术的结合,能否产生更优的融合结果?
- RQ5该方法在焦点转换发生的边缘与边界区域是否具有鲁棒性?
主要发现
- SESF-Fuse 在17种方法中于 $Q_{g}$ 与 $Q_{cb}$ 指标上取得最高平均分,分别为 $Q_{g} = 0.7105$ 与 $Q_{cb} = 0.7848$,优于全部16种基线方法。
- 该方法在 $Q_{m}$ 指标上表现最佳,得分为 2.8886,表明其具有更优的鲁棒性与一致性。
- 主观评价显示,SESF-Fuse 生成的图像更清晰、更准确,尤其在聚焦与模糊区域之间的边界和过渡区域表现更优。
- 与需要合成数据进行有监督训练的 CNN-Fuse 不同,SESF-Fuse 完全采用无监督方式,显著降低对数据的依赖。
- 差异图像显示,SESF-Fuse 最准确地检测出聚焦区域,残留信息最少,优于 DWT、CVT 与 DenseFuse 等方法。
- 该方法在复杂场景中成功保留了细微细节,例如在‘悉尼歌剧院’图像中考拉的耳朵与人物细节处,其他方法产生模糊或不一致结果,而 SESF-Fuse 表现更佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。