Skip to main content
QUICK REVIEW

[论文解读] PGMAN: An Unsupervised Generative Multi-adversarial Network for Pan-sharpening

Huanyu Zhou, Qingjie Liu|arXiv (Cornell University)|Dec 16, 2020
Advanced Image Fusion Techniques参考文献 48被引用 4
一句话总结

PGMAN 提出了一种无监督生成式多对抗网络用于全分辨率图像融合,直接在未下采样的全分辨率全色(PAN)和多光谱(MS)图像上进行训练,无需真实标签。该方法采用双流生成器、双判别器以保持光谱和空间保真度,并结合一种新型 Q-loss 与对抗损失,实现了在全分辨率高分-2、快鸟和WorldView-3数据集上的最先进性能。

ABSTRACT

Pan-sharpening aims at fusing a low-resolution (LR) multi-spectral (MS) image and a high-resolution (HR) panchromatic (PAN) image acquired by a satellite to generate an HR MS image. Many deep learning based methods have been developed in the past few years. However, since there are no intended HR MS images as references for learning, almost all of the existing methods down-sample the MS and PAN images and regard the original MS images as targets to form a supervised setting for training. These methods may perform well on the down-scaled images, however, they generalize poorly to the full-resolution images. To conquer this problem, we design an unsupervised framework that is able to learn directly from the full-resolution images without any preprocessing. The model is built based on a novel generative multi-adversarial network. We use a two-stream generator to extract the modality-specific features from the PAN and MS images, respectively, and develop a dual-discriminator to preserve the spectral and spatial information of the inputs when performing fusion. Furthermore, a novel loss function is introduced to facilitate training under the unsupervised setting. Experiments and comparisons with other state-of-the-art methods on GaoFen-2 and QuickBird images demonstrate that the proposed method can obtain much better fusion results on the full-resolution images.

研究动机与目标

  • 解决监督式图像融合方法中存在的泛化差距问题,即在下采样图像上进行训练但测试时使用全分辨率数据。
  • 开发一种无监督深度学习框架,直接从全分辨率全色和多光谱图像中学习,而无需依赖真实高分辨率多光谱图像作为监督信号。
  • 通过双判别器架构和一种新型基于 QNR 的损失函数,同时保持融合图像的光谱与空间保真度。
  • 提升在全分辨率遥感图像上的性能,因为现有监督模型由于领域偏移问题在全分辨率数据上表现不佳。

提出的方法

  • 双流生成器分别独立提取高分辨率全色(PAN)图像和低分辨率多光谱(MS)图像的模态特异性特征。
  • 采用双判别器架构:一个判别器评估光谱一致性(D1),另一个判别器评估空间真实性(D2),以确保光谱与空间保真度。
  • 引入一种新型 Q-loss,通过将生成的高分辨率多光谱图像与真实高分辨率多光谱图像的降质版本进行比较,来衡量其质量,从而实现无监督训练。
  • 整体损失函数结合了对抗损失与 Q-loss,通过调节超参数 α 和 β 来平衡两个损失分量。
  • 模型通过仅使用原始全色和多光谱图像进行端到端训练,避免了任何下采样或预处理步骤。
  • Q-loss 的退化过程通过将生成的高分辨率多光谱图像下采样至与低分辨率多光谱图像相同的分辨率来模拟,形成一致性约束。

实验结果

研究问题

  • RQ1无监督深度学习模型是否能在无需真实高分辨率多光谱图像的情况下,实现对全分辨率遥感图像的优越图像融合性能?
  • RQ2在缺乏监督的情况下,如何联合最小化光谱与空间失真?
  • RQ3在无监督设置下,哪些损失组件对基于 GAN 的图像融合模型训练最为有效?
  • RQ4所提出的 Q-loss 与标准对抗损失相比,在保持图像质量和一致性方面表现如何?
  • RQ5双判别器架构是否能有效分离图像融合中光谱保真度与空间保真度的优化?

主要发现

  • PGMAN 在高分-2、快鸟和 WorldView-3 数据集的全分辨率图像上均实现了最先进性能,优于现有监督与无监督方法。
  • Q-loss 与对抗损失的结合效果最佳,其中 Q-loss 提供了强于仅使用对抗损失的约束力。
  • 在高分-2 数据集上,PSNR 达到 32.15 dB,在 WorldView-3 上达到 30.87 dB,显著优于先前的无监督方法。
  • PGMAN 效率高,单张图像在单张 GPU 上的推理时间仅为 0.0004 秒,且仅有 0.385M 可训练参数。
  • 参数分析表明,当 α=2e-4 且 β=1e-4 时性能最优,能有效平衡双判别器的训练。
  • 该模型在全分辨率图像上泛化能力良好,表明在原始数据上进行无监督训练可避免因下采样训练协议导致的领域偏移问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。