Skip to main content
QUICK REVIEW

[论文解读] Guided Deep Decoder: Unsupervised Image Pair Fusion

Tatsumi Uezato, Danfeng Hong|arXiv (Cornell University)|Jul 23, 2020
Advanced Image Fusion Techniques参考文献 46被引用 6
一句话总结

本文提出了一种引导式深度解码器(GDD),这是一种新颖的无监督深度学习框架,用于图像对融合,通过利用引导图像的多尺度语义特征来正则化深度解码器网络,而无需任何训练数据。通过集成注意力门控特征精炼单元,GDD在多种图像融合任务中实现了最先进性能,包括高光谱超分辨率、全色融合以及带闪光/无闪光去噪,有效平衡了重建输出中的光谱保真度与空间保真度。

ABSTRACT

The fusion of input and guidance images that have a tradeoff in their information (e.g., hyperspectral and RGB image fusion or pansharpening) can be interpreted as one general problem. However, previous studies applied a task-specific handcrafted prior and did not address the problems with a unified approach. To address this limitation, in this study, we propose a guided deep decoder network as a general prior. The proposed network is composed of an encoder-decoder network that exploits multi-scale features of a guidance image and a deep decoder network that generates an output image. The two networks are connected by feature refinement units to embed the multi-scale features of the guidance image into the deep decoder network. The proposed network allows the network parameters to be optimized in an unsupervised way without training data. Our results show that the proposed network can achieve state-of-the-art performance in various image fusion problems.

研究动机与目标

  • 解决图像融合中任务特定手工设计先验的局限性,这些先验在不同融合问题间不具备泛化能力。
  • 开发一种统一的、无需数据的深度学习框架,可在无需成对训练数据的情况下应用于多种图像融合任务。
  • 通过将引导图像中的语义与空间特征整合到深度解码器架构中,提升无监督图像融合的性能。
  • 通过使用通用的归纳偏置,克服现有深度学习模型在特定传感器合成数据上训练后泛化能力不足的问题。

提出的方法

  • 所提方法采用双分支网络架构:一个编码器-解码器网络用于从引导图像中提取多尺度语义特征,另一个深度解码器网络用于从随机噪声生成输出图像。
  • 引入带有注意力门控的特征精炼单元,以动态地将引导图像的多尺度特征注入深度解码器,实现条件生成。
  • 整个网络采用无监督方式训练,仅依赖输入图像与引导图像对,无需真实参考图像。
  • 深度解码器充当学习到的正则化器,利用网络架构的归纳偏置来解决病态的图像融合问题。
  • 注意力机制确保引导图像中的高层语义特征引导生成具有空间一致性和光谱准确性的输出。
  • 该框架端到端可微分,并通过重建损失进行优化,以最小化生成图像与输入图像之间的差异,同时保留引导图像的先验信息。

实验结果

研究问题

  • RQ1能否开发一种统一的深度学习框架,用于多种图像融合任务,而无需依赖任务特定的手工设计先验?
  • RQ2如何有效利用引导图像的多尺度特征对深度解码器进行条件化,以在无监督设置下提升重建质量?
  • RQ3基于注意力的特征精炼在多大程度上能改善图像融合中光谱保真度与空间保真度之间的平衡?
  • RQ4无数据深度学习模型能否在全色融合和带闪光/无闪光去噪等图像融合任务中实现最先进性能?
  • RQ5所提出的引导式深度解码器是否能在无需微调或合成数据的情况下,跨不同传感器和成像模态实现良好泛化?

主要发现

  • GDD在合成图像融合基准测试中达到最先进性能,优于PanNet、PNN、DRPNN和DIP等多种方法,多项指标(包括Q8、SA、ERGAS和SCC)表现更优。
  • 在无参考的真实全色融合数据上,GDD取得最高的QNR(0.9517),表明其在光谱与空间质量之间实现了最佳平衡。
  • 在去噪任务中,GDD生成的边界更清晰、色彩更自然,相较于DIP展现出更优的感知质量与伪影抑制能力。
  • 在真实数据上,GDD的Dλ(0.0202)和Ds(0.0288)值最低,表明其光谱与空间保真度显著优于其他方法。
  • 消融实验证实,注意力门控特征精炼单元显著提升了重建质量,有效传递了来自引导图像的语义与空间细节。
  • 该方法在多种成像场景下泛化良好,包括高光谱超分辨率、全色融合以及带闪光/无闪光去噪,无需任务特定的微调或数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。