[论文解读] Teaching GANs to Sketch in Vector Format
本文提出SkeGAN,一种新颖的生成对抗网络(GAN)架构,用于生成高质量的矢量格式草图,采用策略梯度方法处理混合连续(偏移量)与离散(笔状态)输出,并提出VASkeGAN,一种变分自编码器-生成对抗网络(VAE-GAN)混合模型。主要贡献在于引入了Ske-score评估指标,并证明将对抗损失与策略梯度损失(权重为1.0)结合可消除‘涂鸦效应’,生成视觉上更优、更自然的草图,且训练速度优于VAE-GAN基线模型。
Sketching is more fundamental to human cognition than speech. Deep Neural Networks (DNNs) have achieved the state-of-the-art in speech-related tasks but have not made significant development in generating stroke-based sketches a.k.a sketches in vector format. Though there are Variational Auto Encoders (VAEs) for generating sketches in vector format, there is no Generative Adversarial Network (GAN) architecture for the same. In this paper, we propose a standalone GAN architecture SkeGAN and a VAE-GAN architecture VASkeGAN, for sketch generation in vector format. SkeGAN is a stochastic policy in Reinforcement Learning (RL), capable of generating both multidimensional continuous and discrete outputs. VASkeGAN hybridizes a VAE and a GAN, in order to couple the efficient representation of data by VAE with the powerful generating capabilities of a GAN, to produce visually appealing sketches. We also propose a new metric called the Ske-score which quantifies the quality of vector sketches. We have validated that SkeGAN and VASkeGAN generate visually appealing sketches by using Human Turing Test and Ske-score.
研究动机与目标
- 解决现有基于生成对抗网络(GAN)的架构在生成基于笔画的矢量草图方面的不足,此类草图是人类认知的基础,且需要处理连续与离散输出的混合特性。
- 通过策略梯度方法克服在矢量草图生成中向后传播梯度至离散笔状态的挑战。
- 提出一种新型评估指标Ske-score,用于定量评估生成的矢量草图质量。
- 证明将对抗损失与策略梯度损失结合可生成视觉质量更优、且‘涂鸦效应’更少的草图,优于先前基于变分自编码器(VAE)的模型。
- 在保持或提升视觉质量的同时,实现比VAE-GAN基线更快的训练收敛速度。
提出的方法
- 提出SkeGAN,一种独立的GAN架构,利用策略梯度方法建模矢量草图中2D连续偏移量与3D离散笔状态的随机生成过程。
- 在SkeGAN中引入一种新颖的耦合机制,以建模绘制过程中偏移量对笔状态转换的影响。
- 设计VASkeGAN作为VAE-GAN混合架构,结合变分自编码器(VAE)的高效潜在表征与生成对抗网络(GAN)的判别能力,以提升生成样本质量。
- 开发Ske-score评估指标,基于人类评估与真实草图的结构相似性,量化矢量草图的感知质量。
- 使用结合对抗损失与策略梯度损失的平衡损失函数训练SkeGAN,并通过超参数消融实验确定最优损失权重。
- 在两种模型中均采用GRU与LSTM结构的判别器,并通过消融实验为每类草图选择最优判别器架构。
![Figure 1: Scribble effect of [ 11 ] with yoga pose sketches (left) and mosquito sketches (right).](https://ar5iv.labs.arxiv.org/html/1904.03620/assets/Figures/smudgedYoga.png)
实验结果
研究问题
- RQ1基于GAN的架构能否在不依赖变分自编码器(VAE)的情况下,有效生成具有混合连续与离散输出(偏移量与笔状态)的高质量矢量草图?
- RQ2将策略梯度损失与对抗训练相结合,对生成矢量草图的视觉质量与结构一致性有何影响?
- RQ3所提出的Ske-score评估指标在多大程度上与人类对草图质量的感知相关?
- RQ4哪些超参数设置(如损失权重)能在视觉质量与训练稳定性之间实现最佳权衡?
- RQ5SkeGAN在样本质量与训练效率方面是否优于VASkeGAN?
主要发现
- 与VASkeGAN相比,SkeGAN生成的草图在视觉上更优,笔画更清晰、更自然、更具艺术性,与真实人类绘制的草图高度相似。
- 策略梯度损失与对抗损失的最优权重均为1.0,该配置可最大化Ske-score并最小化‘涂鸦效应’。
- 随着策略梯度损失权重的增加,Ske-score也随之提升;当Ske-score接近真实数据集水平(猫类:0.18 ± 0.07,消防车类:0.12 ± 0.05)时,表明‘涂鸦效应’得到有效缓解。
- VASkeGAN在不同KL散度损失权重(w_KL = 0.25, 0.5, 1.0)下Ske-score无显著变化,表明w_KL与草图质量之间无明显相关性。
- SkeGAN的训练收敛速度优于VASkeGAN,仅需9.88至19.77小时(对比VAE-GAN基线的33.33小时)即可完成200,000次迭代,归因于更高效的梯度更新。
- LSTM判别器在多数类别中表现优于GRU,仅在‘firetruck’类别中GRU表现更佳,凸显判别器选择对草图类别的敏感性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。