Skip to main content
QUICK REVIEW

[论文解读] IMAGINE: Image Synthesis by Image-Guided Model Inversion

Pei Wang, Yijun Li|arXiv (Cornell University)|Apr 13, 2021
Generative Adversarial Networks and Image Synthesis参考文献 47被引用 5
一句话总结

IMAGINE 提出了一种新颖的图像生成方法,通过利用预训练分类器进行图像引导的模型反演,从单张参考图像生成多样化且高质量的图像。它通过多层次特征匹配和对抗性训练来强制实现语义一致性,在不训练生成器的情况下实现逼真的结果,同时支持对形状、风格和语义的直观控制。

ABSTRACT

We introduce an inversion based method, denoted as IMAge-Guided model INvErsion (IMAGINE), to generate high-quality and diverse images from only a single training sample. We leverage the knowledge of image semantics from a pre-trained classifier to achieve plausible generations via matching multi-level feature representations in the classifier, associated with adversarial training with an external discriminator. IMAGINE enables the synthesis procedure to simultaneously 1) enforce semantic specificity constraints during the synthesis, 2) produce realistic images without generator training, and 3) give users intuitive control over the generation process. With extensive experimental results, we demonstrate qualitatively and quantitatively that IMAGINE performs favorably against state-of-the-art GAN-based and inversion-based methods, across three different image domains (i.e., objects, scenes, and textures).

研究动机与目标

  • 解决现有基于 GAN 和基于反演的方法在从单张参考图像生成语义上有意义的变体方面的局限性。
  • 克服分类器反演方法缺乏具体性的问题,后者生成的是通用类别级别的图像而非特定图像的变体。
  • 通过利用预训练分类器和对抗性优化,实现无需训练专用生成器的高保真、多样化图像生成。
  • 通过在不同网络层上操纵特征统计量,为用户提供对图像生成的直观控制。
  • 将模型反演的应用从图像重建扩展到语义编辑、风格迁移和反事实解释。

提出的方法

  • 使用预训练分类器(例如 ResNet-50)从参考图像中提取多层次特征表示,作为生成过程中的语义约束。
  • 通过分布匹配正则化,在分类器的多个网络层上优化生成图像,使其与参考图像的特征分布相匹配。
  • 通过交替优化生成图像和判别器权重引入对抗性训练,提升真实感,而无需训练生成器。
  • 通过在不同网络深度处操纵目标特征统计量,实现语义控制,支持形状或身份的修改。
  • 通过将特征匹配正则化替换为来自风格图像的统计量,支持风格迁移,利用低层特征引导风格注入。
  • 通过结合区域级显著性掩码与特征匹配,实现反事实解释,将反事实图像中的判别性区域翻译到查询图像中。

实验结果

研究问题

  • RQ1能否有效将预训练分类器的模型反演重新用于具有语义保真度的参考图像引导图像生成?
  • RQ2如何将对抗性训练整合到图像优化流程中,以在不训练生成器的情况下提升真实感?
  • RQ3在不同网络深度处的特征统计量在多大程度上能够实现对形状和身份等语义属性的直观控制?
  • RQ4该方法在非重复性、高语义内容的图像上是否具有泛化能力,这些图像中基于补丁的方法(如 SinGAN)会失效?
  • RQ5该框架能否在不改变优化框架的前提下,支持风格迁移和反事实视觉解释等附加应用?

主要发现

  • 在物体、场景和纹理等各类图像上,IMAGINE 生成的图像质量更高、多样性更强,优于当前最先进的基于 GAN 和基于反演的方法。
  • 该方法成功生成了非重复性图像(如鸵鸟和金鱼),而 SinGAN 因语义身份和结构丢失而失效。
  • 通过在不同层操纵特征统计量,IMAGINE 实现了形状编辑,例如从剪贴画参考图像生成轮廓被修改的物体。
  • 对抗性训练的引入显著提升了图像的真实感,相比基线分类器反演方法,实现了更具感知真实感的结果。
  • 通过将低层特征统计量替换为来自风格图像的统计量,该方法实现了有效的风格迁移,生成了目标图像的风格化变体。
  • 通过将反事实图像中的判别性区域翻译到查询图像中,生成了直观的、局部化且语义明确的图像空间反事实解释。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。