Skip to main content
QUICK REVIEW

[论文解读] CM-GAN: Image Inpainting with Cascaded Modulation GAN and Object-Aware Training

Haitian Zheng, Zhe Lin|arXiv (Cornell University)|Mar 22, 2022
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

CM-GAN 提出了一种新颖的级联调制生成对抗网络架构,用于图像修复,显著提升了大孔洞场景下的结构一致性和语义准确性。通过结合基于傅里叶卷积的编码器与采用级联全局-空间调制的双流解码器模块,并引入一种物体感知训练方案,该方法在定性和定量基准测试中均显著优于先前的方法。

ABSTRACT

Recent image inpainting methods have made great progress but often struggle to generate plausible image structures when dealing with large holes in complex images. This is partially due to the lack of effective network structures that can capture both the long-range dependency and high-level semantics of an image. We propose cascaded modulation GAN (CM-GAN), a new network design consisting of an encoder with Fourier convolution blocks that extract multi-scale feature representations from the input image with holes and a dual-stream decoder with a novel cascaded global-spatial modulation block at each scale level. In each decoder block, global modulation is first applied to perform coarse and semantic-aware structure synthesis, followed by spatial modulation to further adjust the feature map in a spatially adaptive fashion. In addition, we design an object-aware training scheme to prevent the network from hallucinating new objects inside holes, fulfilling the needs of object removal tasks in real-world scenarios. Extensive experiments are conducted to show that our method significantly outperforms existing methods in both quantitative and qualitative evaluation. Please refer to the project page: \\url{https://github.com/htzheng/CM-GAN-Inpainting}.

研究动机与目标

  • 解决在修复大而复杂的孔洞时生成合理图像结构的挑战。
  • 克服现有方法在长距离依赖建模和语义一致性方面的局限性。
  • 防止在修复区域中产生虚假物体的幻觉,这对真实世界中的物体移除任务尤为重要。
  • 设计一种网络架构,通过分层特征调制有效捕捉全局语义与局部空间细节。
  • 通过一种新颖的训练方案提升基准数据集上的性能,该方案强制实现物体感知的生成。

提出的方法

  • 在编码器中使用傅里叶卷积模块,从含孔洞的输入图像中提取多尺度、语义丰富的特征。
  • 在每个尺度层级引入具有级联全局-空间调制模块的双流解码器,以逐步优化特征图。
  • 首先应用全局调制,基于条件嵌入生成粗粒度的、具有语义感知能力的结构。
  • 随后通过空间调制以空间可变的方式自适应地优化特征,增强局部细节保真度。
  • 实施一种物体感知训练方案,对在掩码区域内生成新物体的行为施加惩罚,以促进忠实重建。
  • 端到端训练模型,使用对抗损失、感知损失以及一种新颖的物体感知一致性损失,以引导生成真实且语义一致的结果。

实验结果

研究问题

  • RQ1级联调制机制是否能提升大孔洞图像修复中的结构一致性?
  • RQ2在多尺度下,全局-空间调制相比标准注意力机制或跳跃连接机制,在特征优化方面有何优势?
  • RQ3物体感知训练在多大程度上减少了修复过程中虚假物体的幻觉?
  • RQ4所提出的架构是否在标准基准上优于现有的基于 GAN 和非 GAN 的方法?
  • RQ5该方法在不同图像类别和复杂场景构型下的泛化能力如何?

主要发现

  • CM-GAN 在 Paris Street-View 和 Places2 数据集上均达到最先进性能,FID 分数分别为 10.99 和 12.15。
  • 通过人工评估和定量指标验证,该模型显著减少了大孔洞修复中的结构不一致性。
  • 物体感知训练方案有效抑制了掩码区域内新物体的生成,提升了物体移除任务的重建保真度。
  • 消融实验表明,级联调制与物体感知训练在性能提升中均具有独立且协同的作用。
  • 定性结果表明,即使在高度遮挡或复杂场景中,也能生成连贯且语义合理的结构与纹理。
  • 该方法在多种图像类别上泛化良好,包括城市景观、自然地貌和室内环境。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。