Skip to main content
QUICK REVIEW

[论文解读] SketchyCOCO: Image Generation from Freehand Scene Sketches

Chengying Gao, Qi Liu|arXiv (Cornell University)|Mar 5, 2020
Generative Adversarial Networks and Image Synthesis参考文献 39被引用 6
一句话总结

本文提出 EdgeGAN,一种条件生成对抗网络框架,通过利用跨域属性嵌入的共享潜在空间,从手绘草图生成高保真、逼真的场景级图像。该方法将图像生成分解为前景和背景两个阶段,无需使用草图-图像配对训练数据,即可实现可控的高质量合成,并在新提出的 SketchyCOCO 数据集上达到最先进性能。

ABSTRACT

We introduce the first method for automatic image generation from scene-level freehand sketches. Our model allows for controllable image generation by specifying the synthesis goal via freehand sketches. The key contribution is an attribute vector bridged Generative Adversarial Network called EdgeGAN, which supports high visual-quality object-level image content generation without using freehand sketches as training data. We have built a large-scale composite dataset called SketchyCOCO to support and evaluate the solution. We validate our approach on the tasks of both object-level and scene-level image generation on SketchyCOCO. Through quantitative, qualitative results, human evaluation and ablation studies, we demonstrate the method's capacity to generate realistic complex scene-level images from various freehand sketches.

研究动机与目标

  • 为解决从抽象、不完整且风格多样的手绘草图生成逼真、复杂的场景级图像的挑战。
  • 实现可控图像生成,使用户可通过直观的手绘草图表达意图,而非使用文本或语义图。
  • 通过在无草图-图像配对数据的情况下训练,利用边缘图作为代理监督,克服草图图像生成的数据稀缺问题。
  • 构建一个大规模、多样化的数据集——SketchyCOCO,支持对象级和场景级草图到图像的生成。
  • 开发一种模型,能够生成与草图细节匹配的逼真前景,同时生成合理、连贯的背景。

提出的方法

  • 提出 EdgeGAN,一种具有共享潜在空间的条件生成对抗网络,通过共享编码器将图像和边缘图嵌入到联合嵌入空间。
  • 使用解耦的属性向量,从多样的草图风格中捕捉高层对象属性(如姿态、形状、外观),实现对未见草图风格的零样本泛化。
  • 将图像生成分解为两个阶段:(1) 基于详细草图的前景生成,(2) 基于前景和粗略背景草图的背景生成。
  • 采用联合判别器,强制生成图像与其对应边缘图之间的一致性,提升图像保真度和真实感。
  • 端到端训练仅使用图像与边缘图配对数据,通过共享潜在空间避免对草图-图像配对数据的需求。
  • 使用多尺度判别器,提升局部和全局图像质量,尤其在复杂场景区域表现更优。

实验结果

研究问题

  • RQ1深度生成模型能否在无需草图-图像配对训练数据的情况下,从手绘草图生成逼真、高质量的场景级图像?
  • RQ2模型在多样化草图风格(包括抽象和不完整绘图)上的泛化能力如何?
  • RQ3共享潜在空间在不同草图风格与图像域之间实现解耦属性学习的程度如何?
  • RQ4渐进式生成策略(先前景后背景)在提升复杂场景的真实感与连贯性方面效果如何?
  • RQ5与现有草图到图像方法相比,该模型在视觉质量、保真度和用户感知方面表现如何?

主要发现

  • EdgeGAN 在对象级和场景级图像生成上均达到最先进性能,在定性和定量评估中均优于现有方法。
  • 人工评估显示,尽管 FID 分数略逊于 GauGAN,EdgeGAN 生成的图像在真实感方面表现最佳,尤其在前景对象质量上优势明显。
  • 模型对未见草图风格泛化良好,包括 Canny、FDoG、Photocopy、Photo-sketch 和 XDoG 边缘图,即使未出现在训练数据中。
  • 背景生成稳健且可控:添加或修改背景草图可导致语义一致且合理的场景变化。
  • 模型成功生成了如物体下方阴影(例如长颈鹿)等逼真场景细节,表明其具备强大的空间与结构理解能力。
  • 消融实验证实,共享潜在空间和属性向量对于解耦高层属性以及实现零样本草图泛化至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。