Skip to main content
QUICK REVIEW

[论文解读] SketchEmbedNet: Learning Novel Concepts by Imitating Drawings

Alexander Wang, Mengye Ren|arXiv (Cornell University)|Aug 27, 2020
Multimodal Machine Learning Applications参考文献 53被引用 4
一句话总结

SketchEmbedNet 提出了一种无类别依赖的编码器-解码器模型,通过训练神经网络生成图像的序列草图来学习图像表征。通过模仿人类的草图绘制过程,该模型生成结构化、组合式的嵌入表征,即使在训练过程中未使用类别标签,也能在未见类别和数据集上实现强大的少样本分类性能。

ABSTRACT

Sketch drawings capture the salient information of visual concepts. Previous work has shown that neural networks are capable of producing sketches of natural objects drawn from a small number of classes. While earlier approaches focus on generation quality or retrieval, we explore properties of image representations learned by training a model to produce sketches of images. We show that this generative, class-agnostic model produces informative embeddings of images from novel examples, classes, and even novel datasets in a few-shot setting. Additionally, we find that these learned representations exhibit interesting structure and compositionality.

研究动机与目标

  • 开发一种表征学习方法,通过训练模型生成图像的草图来捕捉显著的视觉特征。
  • 通过仅使用图像到草图生成训练的无类别依赖模型,实现在新类别和数据集上的少样本泛化能力。
  • 探究基于草图的生成是否能产生比基于像素的生成更具结构性、组合性且信息量更高的图像嵌入表征。
  • 通过在草图表征上执行向量算术运算,评估所学嵌入的组合性质。

提出的方法

  • 使用基于像素的图像编码器,从自然图像中生成潜在的 SketchEmbedding 向量。
  • 采用基于 SketchRNN 的序列自回归解码器,从潜在嵌入中生成表示草图的笔触序列。
  • 采用端到端的重建目标进行训练,最小化真实草图序列与生成草图序列之间的差异。
  • 利用涵盖多样化图像类别的广泛数据集(例如来自 QuickDraw 和 ImageNet 的数据),学习一种通用的、无类别依赖的表征。
  • 在训练过程中应用对比学习和自监督学习目标,以提升表征质量。
  • 通过在 Omniglot 和 mini-ImageNet 上使用所学嵌入进行零样本和少样本分类,评估下游性能。

实验结果

研究问题

  • RQ1一个训练为生成图像草图的生成模型,是否能在不使用类别标签的情况下学习到信息丰富且可泛化的图像表征?
  • RQ2SketchEmbedNet 模型在少样本设置下对新类别和新数据集的泛化能力如何?
  • RQ3所学的 SketchEmbedding 是否表现出组合性和空间结构,从而支持通过向量算术操作来操控概念?
  • RQ4在下游分类性能方面,基于草图的表征学习与基于像素的生成相比表现如何?
  • RQ5所生成的草图在多大程度上保留了语义意义和形状结构,尤其是在复杂或抽象概念上?

主要发现

  • SketchEmbedNet 仅通过基于草图的表征学习,在 Omniglot 少样本分类基准上实现了 97.66% 的准确率,优于基线模型。
  • 在 mini-ImageNet 基准上,SketchEmbedNet 在已见类别的少样本分类中达到 81.44% 的准确率,在未见类别的分类中达到 77.94%,表现出强大的零样本泛化能力。
  • 该模型能泛化到训练过程中未见过的新数据集,包括 QuickDraw 和 Omniglot 等未见领域,在已见和未见类别上均表现出高绩效。
  • SketchEmbedNet 的嵌入支持概念组合:对嵌入执行向量算术操作(例如加法和减法)可产生有意义的视觉结果,例如通过组合或修改概念生成新形状。
  • 定性分析表明,与基于像素的生成方法相比,所生成的草图在保留形状和结构细节方面表现更优,尤其在书写字符和具有清晰组件级结构的物体上。
  • 该模型在分类准确率和草图可识别性方面均优于 Conv-VAE 基线模型,表明基于草图的生成相比仅基于像素的生成,能产生更具语义意义的表征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。