Skip to main content
QUICK REVIEW

[论文解读] Interactive Sketch & Fill: Multiclass Sketch-to-Image Translation

Arnab Ghosh, Richard Zhang|arXiv (Cornell University)|Sep 24, 2019
Generative Adversarial Networks and Image Synthesis参考文献 61被引用 16
一句话总结

本文提出了一种基于GAN的交互式草图到图像系统,能够实时完成用户绘制的不完整草图轮廓,并生成特定类别的图像。该系统采用两阶段流程:首先通过形状补全网络完成形状,然后通过基于门控的条件生成器,基于补全后的轮廓和类别标签生成逼真的图像。该方法实现了从稀疏草图出发的高精度、多类别图像合成,优于简单的拼接方法,且仅使用单一共享生成器即可实现接近每类专用生成器的性能。

ABSTRACT

We propose an interactive GAN-based sketch-to-image translation method that helps novice users create images of simple objects. As the user starts to draw a sketch of a desired object type, the network interactively recommends plausible completions, and shows a corresponding synthesized image to the user. This enables a feedback loop, where the user can edit their sketch based on the network's recommendations, visualizing both the completed shape and final rendered image while they draw. In order to use a single trained model across a wide array of object classes, we introduce a gating-based approach for class conditioning, which allows us to generate distinct classes without feature mixing, from a single generator network. Video available at our website: https://arnabgho.github.io/iSketchNFill/.

研究动机与目标

  • 使新手用户能够通过交互式、逐步绘制草图的方式创建简单物体的逼真图像。
  • 解决从不完整、稀疏草图生成多样化、类别特定图像的挑战,而无需依赖密集边缘图。
  • 开发一个单一、可扩展的生成器,支持多种物体类别且不发生特征混合,利用新颖的门控机制实现有效的类别条件控制。
  • 通过建议合理的形状补全和对应的图像结果,实现在草图过程中的实时反馈。

提出的方法

  • 采用两阶段框架:首先,形状补全网络从稀疏用户笔画中预测出完整且合理的轮廓。
  • 其次,多类别条件 GAN 基于补全后的轮廓和用户提供的类别标签生成逼真图像。
  • 通过门控机制(特别是通道级软门控,如 ChannelGate)作用于生成器,实现类别特定的特征调制,防止类别间特征混合。
  • 门控机制应用于各层(例如残差块中),并包含可学习偏置,使网络能够聚焦于与类别相关的激活。
  • 系统在所有类别上使用单一共享的生成器和判别器,训练数据集包含10种不同物体类别,涵盖圆形和复杂形状。
  • 界面提供实时视觉反馈:补全形状(灰色)、合成图像(彩色)和用户编辑(绿色/红色),支持交互式优化。

实验结果

研究问题

  • RQ1单一条件 GAN 生成器是否能有效从不完整草图中生成多样化、类别特定的图像,且不发生特征混合?
  • RQ2两阶段方法(先形状补全,再图像生成)是否相比直接的草图到图像映射,能提升训练稳定性并改善用户反馈?
  • RQ3与简单拼接或自适应实例归一化相比,基于门控的条件控制机制在多类别草图到图像转换中的有效性如何?
  • RQ4该模型是否能泛化到未见过的形状-类别组合,例如圆形轮廓生成菠萝或 cupcake?
  • RQ5所提方法是否在保持单一、可部署模型的前提下,实现与每类专用生成器相当的性能?

主要发现

  • 基于门控的条件控制机制(尤其是 ChannelGate)在测试集上达到 99.6% 的分类准确率,显著优于简单拼接方法(64.5%),并接近每类专用生成器的性能(97.0%)。
  • 采用门控机制的 SkinnyResNet 架构在人类评估中表现出 23.4% 的欺骗率,优于每类专用生成器的 17.7%,表明其在真实感方面表现更优,泛化能力更强且伪影更少。
  • 两阶段方法显著优于直接从不完整轮廓映射到图像的基线方法,因为中间的形状补全提供了关键的几何监督。
  • 模型能够基于同一轮廓(如圆形)生成具有明显类别差异的图像(如篮球、西瓜、cupcake、菠萝),即使缺乏冠部或底部等结构线索。
  • 系统在复杂形状(如人脸和鞋子)上也表现出良好的泛化能力,表明其鲁棒性不仅限于简单圆形物体。
  • 门控机制实现了类别的清晰分离,使单一生成器能够在不性能下降的前提下,为10种物体类别生成高质量、多样化的输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。