Skip to main content
QUICK REVIEW

[论文解读] Controllable and Progressive Image Extrapolation

Yijun Li, Lu Jiang|arXiv (Cornell University)|Dec 25, 2019
Generative Adversarial Networks and Image Synthesis参考文献 53被引用 9
一句话总结

本文提出了一种渐进式、可控的图像外推框架,利用场景图作为条件控制生成逼真的图像扩展。通过将任务分解为三个阶段——边界框布局生成、语义分割布局优化和图像到图像的转换,该模型实现了高质量、多样化且受文本引导的图像合成,同时提升了训练稳定性和用户控制能力。

ABSTRACT

Image extrapolation aims at expanding the narrow field of view of a given image patch. Existing models mainly deal with natural scene images of homogeneous regions and have no control of the content generation process. In this work, we study conditional image extrapolation to synthesize new images guided by the input structured text. The text is represented as a graph to specify the objects and their spatial relation to the unknown regions of the image. Inspired by drawing techniques, we propose a progressive generative model of three stages, i.e., generating a coarse bounding-boxes layout, refining it to a finer segmentation layout, and mapping the layout to a realistic output. Such a multi-stage design is shown to facilitate the training process and generate more controllable results. We validate the effectiveness of the proposed method on the face and human clothing dataset in terms of visual results, quantitative evaluations and flexible controls.

研究动机与目标

  • 解决现有图像外推方法在生成内容上缺乏控制且受限于无条件生成的局限性。
  • 实现条件化图像外推,使用户可通过结构化文本(场景图)指定期望的对象及其空间关系。
  • 通过将复杂的图像到像素的转换分解为中间布局生成阶段,提升训练稳定性和生成质量。
  • 实现灵活、多样化且语义一致的图像外推结果,同时尊重图像上下文和文本控制信号。

提出的方法

  • 该方法采用三阶段渐进式生成模型:首先从场景图生成粗粒度的边界框布局,然后将其细化为细粒度的语义分割布局,最后将布局转换为逼真的RGB图像。
  • 每个阶段在各自任务(边界框预测、分割、图像转换)上独立预训练,之后进行联合微调,以提升收敛性和性能。
  • 场景图用作输入,以指导对象的放置和空间关系,其中节点表示对象,边编码空间关系(例如,'裙子在身体下方')。
  • 训练期间采用课程学习策略,从较简单的布局生成任务开始,逐步过渡到更复杂的图像合成任务。
  • 该模型利用图像到图像的转换网络(如基于GAN的模型)将最终的分割布局映射为逼真、高保真的输出图像。
  • 中间输出(边界框和分割布局)具有语义意义,是生成过程中的可解释性副产品。

实验结果

研究问题

  • RQ1与端到端的像素级生成相比,多阶段生成模型是否能显著提升图像外推的可控性和质量?
  • RQ2场景图在多大程度上能有效引导外推区域中生成对象的空间位置和身份?
  • RQ3通过中间布局监督的渐进式训练是否能增强模型的收敛性和生成保真度?
  • RQ4该模型在使用不同场景图输入时,能否从同一图像块生成多样化输出?
  • RQ5当数据先验与用户指定的关系冲突时,场景图控制存在哪些局限性?

主要发现

  • 在人类评估中,该方法的用户偏好得分为92.34%,显著优于基线方法(sg2im_r: 2.65%,sg2im_c: 5.01%)。
  • 通过改变场景图,该模型能从同一输入图像块生成多样化且语义一致的外推图像,展现出强大的可控性。
  • 在合成形状数据集上,该模型成功生成了反映场景图中所有对象和关系信息的布局,包括同一对象类型的多个实例。
  • 即使场景图中缺少关系信息,该模型仍能基于数据先验生成合理布局(例如,天空在物体上方),但可能干扰用户控制。
  • 渐进式训练策略相比端到端方法,实现了更快的收敛和更稳定的训练。
  • 该模型的中间输出(边界框和分割布局)具有语义意义,对用户理解与调试具有实用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。