Skip to main content
QUICK REVIEW

[论文解读] Decorating Your Own Bedroom: Locally Controlling Image Generation with Generative Adversarial Networks

Chen Zhang, Yinghao Xu|arXiv (Cornell University)|May 18, 2021
Generative Adversarial Networks and Image Synthesis参考文献 29被引用 6
一句话总结

本文提出LoGAN,一种通过在预训练的StyleGAN2模型中操纵中间特征图并结合内容与风格调制算子及优先级掩码,实现局部图像编辑的方法。该方法无需微调即可实现精确、灵活的编辑操作,如物体移除、插入、旋转和整间房重装,且在卧室合成任务中实现了逼真的图像生成效果。

ABSTRACT

Generative Adversarial Networks (GANs) have made great success in synthesizing high-quality images. However, how to steer the generation process of a well-trained GAN model and customize the output image is much less explored. It has been recently found that modulating the input latent code used in GANs can reasonably alter some variation factors in the output image, but such manipulation usually presents to change the entire image as a whole. In this work, we propose an effective approach, termed as LoGAN, to support local editing of the output image. Concretely, we introduce two operators, i.e., content modulation and style modulation, together with a priority mask to facilitate the precise control of the intermediate generative features. Taking bedroom synthesis as an instance, we are able to seamlessly remove, insert, shift, and rotate the individual objects inside a room. Furthermore, our method can completely clear out a room and then refurnish it with customized furniture and styles. Experimental results show the great potentials of steering the image generation of pre-trained GANs for versatile image editing.

研究动机与目标

  • 为解决在预训练生成对抗网络中实现局部、细粒度控制的挑战,该方法通常仅支持全局编辑。
  • 实现无需微调模型的灵活、用户导向的场景内特定物体编辑,如移除、插入、旋转或重新定位物体。
  • 开发一种方法,支持完全重装房间:清除所有物体并用新家具与新风格重新布置。
  • 通过利用中间特征图与基于优先级掩码的空间推理,保持局部编辑过程中的逼真感与空间一致性。

提出的方法

  • 引入两种调制算子:内容调制用于控制物体身份与位置,风格调制用于改变外观,二者均应用于中间特征图。
  • 采用优先级掩码以解决多物体插入过程中重叠区域的空间冲突,确保正确的图层顺序与视觉一致性。
  • 基于语义分割与几何启发式方法构建布局解析流程,从输入图像中推断房间结构(墙壁、地板、天花板)与物体位置。
  • 在StyleGAN2生成器的特定层级执行编辑操作:物体移除在第4层进行以实现更佳融合,物体插入在第7层进行以最优保留形状与纹理。
  • 对下采样后的物体掩码进行聚类,以识别物体姿态,并通过插值学习到的潜在码聚类中心实现旋转。
  • 采用逐层合成策略,通过在指定位置与层级插入物体逐步构建场景,随后使用采样得到的潜在码执行风格迁移。

实验结果

研究问题

  • RQ1能否有效利用预训练生成对抗网络中的中间特征图,在不微调模型的前提下实现局部、细粒度的图像编辑?
  • RQ2在局部编辑过程中,特别是插入与重新定位时,如何保持多个物体之间的空间关系?
  • RQ3在物体移除与插入等编辑操作中,最优的编辑层级是哪一个,以在融合质量与结构保真度之间取得平衡?
  • RQ4同一预训练生成对抗网络模型是否可用于完全清空房间并用新家具与新风格重新布置?
  • RQ5通过特征空间中的潜在码操作,能在多大程度上实现物体旋转与风格迁移?

主要发现

  • 在生成器第4层执行物体移除可实现与背景最自然的融合,因其感受野更大,视觉一致性优于后续层级。
  • 在第7层执行物体插入可更优地保留物体形状与纹理,优于早期层级(因特征过度平滑导致模糊)。
  • 优先级掩码能有效解决多物体插入过程中的空间冲突,确保复杂场景中正确的图层顺序与视觉合理性。
  • 对下采样物体掩码进行聚类可准确检测物体朝向,并通过插值聚类中心实现平滑旋转。
  • 该方法成功生成与原始布局和背景纹理一致的逼真空置卧室图像,验证了布局解析流程的有效性。
  • 使用采样潜在码进行再着色可生成多样化且视觉一致的结果,证明了该方法在装饰场景中灵活实现风格迁移的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。