[论文解读] Interactive Sketch & Fill: Multiclass Sketch-to-Image Translation
本文提出了一种基于GAN的交互式草图到图像系统,能够实时完成用户绘制的不完整草图轮廓,并生成特定类别的图像。该系统采用两阶段流程:首先通过形状补全网络完成形状,然后通过基于门控的条件生成器,基于补全后的轮廓和类别标签生成逼真的图像。该方法实现了从稀疏草图出发的高精度、多类别图像合成,优于简单的拼接方法,且仅使用单一共享生成器即可实现接近每类专用生成器的性能。
We propose an interactive GAN-based sketch-to-image translation method that helps novice users create images of simple objects. As the user starts to draw a sketch of a desired object type, the network interactively recommends plausible completions, and shows a corresponding synthesized image to the user. This enables a feedback loop, where the user can edit their sketch based on the network's recommendations, visualizing both the completed shape and final rendered image while they draw. In order to use a single trained model across a wide array of object classes, we introduce a gating-based approach for class conditioning, which allows us to generate distinct classes without feature mixing, from a single generator network. Video available at our website: https://arnabgho.github.io/iSketchNFill/.
研究动机与目标
- 使新手用户能够通过交互式、逐步绘制草图的方式创建简单物体的逼真图像。
- 解决从不完整、稀疏草图生成多样化、类别特定图像的挑战,而无需依赖密集边缘图。
- 开发一个单一、可扩展的生成器,支持多种物体类别且不发生特征混合,利用新颖的门控机制实现有效的类别条件控制。
- 通过建议合理的形状补全和对应的图像结果,实现在草图过程中的实时反馈。
提出的方法
- 采用两阶段框架:首先,形状补全网络从稀疏用户笔画中预测出完整且合理的轮廓。
- 其次,多类别条件 GAN 基于补全后的轮廓和用户提供的类别标签生成逼真图像。
- 通过门控机制(特别是通道级软门控,如 ChannelGate)作用于生成器,实现类别特定的特征调制,防止类别间特征混合。
- 门控机制应用于各层(例如残差块中),并包含可学习偏置,使网络能够聚焦于与类别相关的激活。
- 系统在所有类别上使用单一共享的生成器和判别器,训练数据集包含10种不同物体类别,涵盖圆形和复杂形状。
- 界面提供实时视觉反馈:补全形状(灰色)、合成图像(彩色)和用户编辑(绿色/红色),支持交互式优化。
实验结果
研究问题
- RQ1单一条件 GAN 生成器是否能有效从不完整草图中生成多样化、类别特定的图像,且不发生特征混合?
- RQ2两阶段方法(先形状补全,再图像生成)是否相比直接的草图到图像映射,能提升训练稳定性并改善用户反馈?
- RQ3与简单拼接或自适应实例归一化相比,基于门控的条件控制机制在多类别草图到图像转换中的有效性如何?
- RQ4该模型是否能泛化到未见过的形状-类别组合,例如圆形轮廓生成菠萝或 cupcake?
- RQ5所提方法是否在保持单一、可部署模型的前提下,实现与每类专用生成器相当的性能?
主要发现
- 基于门控的条件控制机制(尤其是 ChannelGate)在测试集上达到 99.6% 的分类准确率,显著优于简单拼接方法(64.5%),并接近每类专用生成器的性能(97.0%)。
- 采用门控机制的 SkinnyResNet 架构在人类评估中表现出 23.4% 的欺骗率,优于每类专用生成器的 17.7%,表明其在真实感方面表现更优,泛化能力更强且伪影更少。
- 两阶段方法显著优于直接从不完整轮廓映射到图像的基线方法,因为中间的形状补全提供了关键的几何监督。
- 模型能够基于同一轮廓(如圆形)生成具有明显类别差异的图像(如篮球、西瓜、cupcake、菠萝),即使缺乏冠部或底部等结构线索。
- 系统在复杂形状(如人脸和鞋子)上也表现出良好的泛化能力,表明其鲁棒性不仅限于简单圆形物体。
- 门控机制实现了类别的清晰分离,使单一生成器能够在不性能下降的前提下,为10种物体类别生成高质量、多样化的输出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。