Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Sketch-to-Photo Synthesis

Runtao Liu, Qian Yu|arXiv (Cornell University)|Sep 18, 2019
Generative Adversarial Networks and Image Synthesis参考文献 39被引用 5
一句话总结

本文提出了首个无监督两阶段草图到照片生成模型,将任务分解为形状迁移(草图到灰度照片)和内容增强(灰度到彩色照片)两个阶段,利用自监督去噪和注意力机制来处理草图的抽象化与风格差异。该方法在未配对数据上实现了高保真度、多样化且逼真的生成结果,并具有一个关键延伸能力:能够从照片中生成具有感知意义的草图,而不仅限于标准边缘图。

ABSTRACT

Humans can envision a realistic photo given a free-hand sketch that is not only spatially imprecise and geometrically distorted but also without colors and visual details. We study unsupervised sketch-to-photo synthesis for the first time, learning from unpaired sketch-photo data where the target photo for a sketch is unknown during training. Existing works only deal with style change or spatial deformation alone, synthesizing photos from edge-aligned line drawings or transforming shapes within the same modality, e.g., color images. Our key insight is to decompose unsupervised sketch-to-photo synthesis into a two-stage translation task: First shape translation from sketches to grayscale photos and then content enrichment from grayscale to color photos. We also incorporate a self-supervised denoising objective and an attention module to handle abstraction and style variations that are inherent and specific to sketches. Our synthesis is sketch-faithful and photo-realistic to enable sketch-based image retrieval in practice. An exciting corollary product is a universal and promising sketch generator that captures human visual perception beyond the edge map of a photo.

研究动机与目标

  • 解决在无配对训练数据条件下,从手绘草图生成逼真且多样化的照片的挑战。
  • 克服草图中存在空间形变以及缺乏颜色/纹理细节的双重困难。
  • 通过学习草图与照片域之间的直接、双向映射,实现基于草图的图像检索。
  • 开发一种通用草图生成器,能够捕捉人类视觉感知中的关键特征,超越传统边缘图的局限。

提出的方法

  • 将草图到照片的生成过程分解为两个阶段:首先将草图翻译为灰度照片(形状迁移),然后通过添加颜色和纹理实现内容增强(内容增强)。
  • 在合成的带噪草图组合上使用自监督去噪目标,以提升对草图抽象化和风格差异的鲁棒性。
  • 引入注意力模块,帮助模型在翻译过程中聚焦于相关结构,忽略无关干扰。
  • 采用混合训练策略,使内容增强网络可在有或无参考图像的情况下运行,从而实现多样化的生成输出。
  • 采用双向架构,使得形状迁移网络也能从照片生成草图,从而支持跨域检索。
  • 完全基于未配对的草图与照片数据集进行训练,避免对配对草图-照片样本的依赖。

实验结果

研究问题

  • RQ1当草图与照片未配对且存在显著的空间与风格差异时,能否有效实现无监督的草图到照片生成?
  • RQ2与端到端方法相比,将任务分解为形状迁移与内容增强两个阶段,是否能提升生成结果的保真度与真实感?
  • RQ3自监督去噪目标是否能增强模型对草图抽象化与绘画风格差异的鲁棒性?
  • RQ4在推理阶段无需参考图像的情况下,模型能否生成多样且逼真的输出?
  • RQ5训练好的模型是否可作为通用草图生成器,捕捉超越标准边缘图的感知显著轮廓?

主要发现

  • 所提出的两阶段无监督模型在草图到照片生成任务中,优于无监督边缘到照片方法(如cycleGAN、UGATIT)以及使用配对数据训练的监督方法(如Pix2Pix),即使后者在配对数据上进行训练。
  • 在基于草图的图像检索中,模型在top-5和top-20准确率分别达到37.2%和65.2%,优于使用草图到边缘图映射的基线方法(分别为34.5%和57.7%)。
  • 模型在不同数据集上泛化能力良好,在ShoeV2和无关的pos50K数据集上均取得相似性能,表明其对领域偏移具有鲁棒性。
  • 照片到草图生成能力可生成类似手绘风格的草图,突出感知显著轮廓,在模仿人类草图风格方面优于Canny和HED。
  • 生成的草图并非仅是边缘图,而是反映了人类视觉感知,捕捉了内部标记与结构强调,而不仅依赖于强度对比。
  • 模型的双向特性使得通过将查询和图库映射到同一域(草图或照片)实现跨域检索,简化了检索流程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。