Skip to main content
QUICK REVIEW

[论文解读] Controllable Semantic Image Inpainting

Jin Xu, Yee Whye Teh|arXiv (Cornell University)|Jun 15, 2018
Generative Adversarial Networks and Image Synthesis参考文献 5被引用 5
一句话总结

本文提出了一种可控的语义图像修复方法,基于用户指定的高层语义生成语义一致且局部一致的图像补全结果。该方法结合了解耦的变分自编码器以实现可解释的潜在控制,以及双向PixelCNN以实现细节丰富、上下文感知的生成,从而在无需后处理或对抗性训练的情况下实现用户可控的高质量图像修复。

ABSTRACT

We develop a method for user-controllable semantic image inpainting: Given an arbitrary set of observed pixels, the unobserved pixels can be imputed in a user-controllable range of possibilities, each of which is semantically coherent and locally consistent with the observed pixels. We achieve this using a deep generative model bringing together: an encoder which can encode an arbitrary set of observed pixels, latent variables which are trained to represent disentangled factors of variations, and a bidirectional PixelCNN model. We experimentally demonstrate that our method can generate plausible inpainting results matching the user-specified semantics, but is still coherent with observed pixels. We justify our choices of architecture and training regime through more experiments.

研究动机与目标

  • 为解决现有语义修复方法中缺乏用户控制的问题,这些方法要么产生确定性输出,要么缺乏交互式控制。
  • 在保持局部纹理和结构一致性的同时,实现用户对图像修复中高层语义(如物体类型、颜色、姿态)的操控。
  • 通过确保生成结果的内在一致性,消除对后处理技术(如泊松混合)或对抗性训练的需求。
  • 设计一种训练方案,以同时支持解耦的、可解释的潜在表征和强大的自回归解码器,实现高保真度生成。

提出的方法

  • 使用解耦的PixelVAE将观测到的图像块编码到解耦的潜在空间中,其中每个维度对应一个可解释的语义因子。
  • 采用双向PixelCNN,以正向和反向光栅扫描顺序建模像素依赖关系,从周围观测像素中捕捉局部细节和纹理。
  • 引入两阶段训练流程:首先在完整图像上预训练解耦VAE,然后在掩码图像上联合微调VAE与双向PixelCNN。
  • 应用InfoVAE-MMD目标,以在保持强大生成能力的同时促进潜在空间中的解耦。
  • 通过在推理过程中操纵潜在变量实现用户控制,从而生成多样化且语义一致的修复结果。
  • 采用变分推理框架,其后验近似同时利用上下文和潜在码,最小化在结构化先验下的重建误差。

实验结果

研究问题

  • RQ1深度生成模型能否生成语义一致且局部一致的图像修复结果,并通过用户指定的语义实现可控性?
  • RQ2在变分自编码器框架下,结合强大的自回归解码器时,如何有效学习解耦且可解释的潜在变量?
  • RQ3两阶段训练对图像修复中潜在空间的解耦质量与可控性有何影响?
  • RQ4双向自回归建模能否在不依赖对抗损失或后处理的情况下提升局部细节生成质量?

主要发现

  • 所提方法生成的修复结果多样化、语义一致,且与用户指定的语义完全匹配,无需后处理或对抗性训练。
  • 与单阶段训练相比,两阶段训练显著提升了生成结果的多样性和可控性,减少了噪声和与掩码相关的伪影。
  • 潜在码遍历揭示了可解释的解耦因子,如色调、性别、面部宽度和方位角,证实了模型对高层语义的解耦能力。
  • 当缺失区域较大时,即使上下文信息有限,模型仍能有效保持全局语义因子(如面部宽度、方位角),展现出强大的语义泛化能力。
  • 双向PixelCNN能有效捕捉局部纹理和细节,确保空间一致性,而无需依赖外部混合技术。
  • 单阶段训练导致结果噪声大或不一致,原因是潜在变量仅学习表示目标区域,使其依赖于掩码且泛化能力较差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。