Skip to main content
QUICK REVIEW

[论文解读] RetrieveGAN: Image Synthesis via Differentiable Patch Retrieval

Hung-Yu Tseng, Hsin-Ying Lee|arXiv (Cornell University)|Jul 16, 2020
Generative Adversarial Networks and Image Synthesis参考文献 43被引用 4
一句话总结

RetrieveGAN 提出了一种用于从场景描述中进行条件图像合成的可微分块检索模块,支持端到端训练并实现对相互兼容图像块的迭代选择。通过整合 Gumbel-softmax 的可微性与共现损失,该方法生成的图像更具真实感且多样性更高,且图像块在语义上保持一致且兼容,其在定量指标和用户研究中均优于非可微基线方法。

ABSTRACT

Image generation from scene description is a cornerstone technique for the controlled generation, which is beneficial to applications such as content creation and image editing. In this work, we aim to synthesize images from scene description with retrieved patches as reference. We propose a differentiable retrieval module. With the differentiable retrieval module, we can (1) make the entire pipeline end-to-end trainable, enabling the learning of better feature embedding for retrieval; (2) encourage the selection of mutually compatible patches with additional objective functions. We conduct extensive quantitative and qualitative experiments to demonstrate that the proposed method can generate realistic and diverse images, where the retrieved patches are reasonable and mutually compatible.

研究动机与目标

  • 解决半参数化图像生成中非可微检索的局限性,即预定义的嵌入向量与生成过程脱钩。
  • 通过在检索过程中建模其共现关系,提升检索到的图像块之间的相互兼容性。
  • 通过使检索过程可微,实现检索与生成流水线的端到端训练。
  • 通过联合优化块嵌入与基于场景图输入的生成过程,提升图像合成质量。
  • 验证可微的、迭代的检索能够生成更具真实感和多样性的图像,并确保图像块在语义上的一致性。

提出的方法

  • 引入一种基于 Gumbel-softmax 技巧的可微分检索模块,使反向传播能够通过离散检索操作。
  • 采用迭代检索策略,逐个选择图像块,且每次选择均基于已选图像块进行条件控制,以确保兼容性。
  • 设计一种共现损失函数,通过建模真实图像中图像块的共现模式,促使所选图像块之间保持相互兼容。
  • 使用真实标签选择损失,引导检索模块选择与场景图语义相关联的图像块。
  • 将检索到的图像块与基于条件 GAN 的图像生成网络结合,生成最终图像。
  • 端到端训练整个流水线,使检索模块能够学习优化图像生成质量的嵌入函数。

实验结果

研究问题

  • RQ1可微分检索能否提升用于条件图像合成的图像块的质量与兼容性?
  • RQ2与独立的、非可微检索相比,迭代的、上下文感知的图像块检索在图像真实感与语义一致性方面表现如何?
  • RQ3检索与生成的联合优化在多大程度上提升了图像保真度与多样性?
  • RQ4所提出的共现损失能否有效建模并强制实现场景中多个物体之间的相互兼容性?
  • RQ5与非可微基线相比,可微分检索模块是否能在复杂场景描述上实现更好的泛化能力与性能表现?

主要发现

  • RetrieveGAN 在 COCO-Stuff 和 Visual Genome 数据集上均取得了当前最优的 FID 分数,表明其生成图像的真实感优于 AttnGAN 和 PasteGAN 等基线方法。
  • 在 COCO-Stuff 数据集上,该方法取得了更高的 Inception Score (IS),表明生成图像的多样性得到提升。
  • 用户研究表明,RetrieveGAN 检索到的图像块在相互兼容性方面显著优于 PasteGAN,且用户对共现的、语义一致的对象组合表现出统计上显著的偏好。
  • 消融实验表明,真实标签选择损失与共现损失均对提升图像质量与图像块兼容性有贡献。
  • 定性结果表明,RetrieveGAN 生成的图像中物体外观更清晰、更真实,且在多个相互作用物体的复杂场景中空间一致性更优。
  • 可微分检索模块支持端到端训练,使嵌入空间能与图像生成器联合优化,从而实现检索图像块与目标图像之间更好的对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。