Skip to main content
QUICK REVIEW

[论文解读] Learning to Sketch with Shortcut Cycle Consistency

Jifei Song, Kaiyue Pang|arXiv (Cornell University)|May 1, 2018
Advanced Image and Video Retrieval Techniques参考文献 42被引用 15
一句话总结

本文提出了一种新颖的深度学习框架,用于实现基于图像的笔画级照片到素描转换,通过引入快捷循环一致性机制,在人类绘制的素描对提供的噪声大、弱监督条件下提升模型鲁棒性。通过结合有监督翻译与域内重建及逆域重建的无监督自监督学习,该模型生成语义上合理且抽象的素描,其在识别与检索基准测试中均优于当前最先进方法,同时还能有效实现细粒度草图基图像检索(FG-SBIR)的数据增强。

ABSTRACT

To see is to sketch -- free-hand sketching naturally builds ties between human and machine vision. In this paper, we present a novel approach for translating an object photo to a sketch, mimicking the human sketching process. This is an extremely challenging task because the photo and sketch domains differ significantly. Furthermore, human sketches exhibit various levels of sophistication and abstraction even when depicting the same object instance in a reference photo. This means that even if photo-sketch pairs are available, they only provide weak supervision signal to learn a translation model. Compared with existing supervised approaches that solve the problem of D(E(photo)) -> sketch, where E($\cdot$) and D($\cdot$) denote encoder and decoder respectively, we take advantage of the inverse problem (e.g., D(E(sketch)) -> photo), and combine with the unsupervised learning tasks of within-domain reconstruction, all within a multi-task learning framework. Compared with existing unsupervised approaches based on cycle consistency (i.e., D(E(D(E(photo)))) -> photo), we introduce a shortcut consistency enforced at the encoder bottleneck (e.g., D(E(photo)) -> photo) to exploit the additional self-supervision. Both qualitative and quantitative results show that the proposed model is superior to a number of state-of-the-art alternatives. We also show that the synthetic sketches can be used to train a better fine-grained sketch-based image retrieval (FG-SBIR) model, effectively alleviating the problem of sketch data scarcity.

研究动机与目标

  • 解决在人类绘制素描对提供的高度噪声监督下进行照片到素描转换学习的挑战,这些素描对在抽象程度和风格上差异极大。
  • 通过结合有监督学习与基于域内重建和逆域转换的无监督自监督学习,提升素描生成质量。
  • 开发一种笔画级生成模型,模拟人类绘制草图的行为,生成既抽象又语义忠实的物体描绘。
  • 评估合成素描是否能有效用于增强真实照片-素描对,以训练出性能更优的细粒度草图基图像检索(FG-SBIR)模型。

提出的方法

  • 模型采用编码器-解码器架构,并在多个任务间共享参数,以支持多任务学习。
  • 通过强制输入照片在不离开照片域的前提下,经由编码器和解码器完成重建,即 D(E(photo)) → photo,引入快捷循环一致性机制。
  • 该框架整合了三项主要任务:(1) 有监督的照片到素描转换 D(E(photo)) → sketch,(2) 逆向素描到照片转换 D(E(sketch)) → photo,以及 (3) 两个域内的域内重建。
  • 在照片编码器中应用变分自编码器风格的KL损失,以实现在潜在空间中解耦且多样的采样,从而从同一输入生成多个不同的素描。
  • 模型通过结合重建损失、循环一致性损失与对抗性目标的多任务损失进行端到端训练。
  • 从未见过的测试照片中生成合成素描,并用于预训练FG-SBIR模型,从而提升下游性能。

实验结果

研究问题

  • RQ1在人类绘制素描监督高度可变的条件下,深度学习模型能否从单张照片生成高质量、抽象且语义上合理的素描?
  • RQ2与完整循环一致性相比,引入快捷循环一致性(即在相同域内重建输入)是否能提升素描生成质量?
  • RQ3由模型生成的合成素描能否有效用作数据增强,以提升细粒度草图基图像检索(FG-SBIR)的性能?
  • RQ4在识别与检索准确率方面,该模型的性能与人类绘制的素描及当前最先进模型相比如何?

主要发现

  • 在ShoeV2数据集上,所提模型在素描识别任务中达到53.50%的top-1准确率,在基于素描的图像检索任务中达到6.00%的top-1准确率,优于所有对比方法,包括人类绘制的素描在识别任务中的表现。
  • 在较小的ChairV2数据集上,模型在识别任务中达到13.00%的top-1准确率,在检索任务中达到8.00%的top-1准确率,甚至超越了强大的CycleGAN-S基线模型。
  • 模型性能显著优于随机猜测(ShoeV2数据集上为0.5% acc.@1,ChairV2数据集上为1%),表明合成素描保留了可识别的实例细节。
  • 在FG-SBIR中用作数据增强时,合成素描使模型的top-1准确率提升了2.10个百分点(从30.33%提升至32.43%)。
  • 潜在空间采样可从同一输入生成多样且全局一致的素描,证明了模型能够生成同一对象的多种合理解释。
  • 模型生成的素描在语义上抽象,且在感知上与简单的光栅化副本明显不同,例如在鞋带和椅子腿等部件上实现了笔画级的渲染。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。