Skip to main content
QUICK REVIEW

[论文解读] SketchParse : Towards Rich Descriptions for Poorly Drawn Sketches using Multi-Task Hierarchical Deep Networks

Ravi Kiran Sarvadevabhatla, Isht Dwivedi|ePrints@IISc (Indian Institute of Science)|Sep 5, 2017
Multimodal Machine Learning Applications参考文献 50被引用 8
一句话总结

SketchParse 提出了一种新颖的多任务层次化深度神经网络,用于完全自动地解析手绘草图,通过利用来自部件标注数据集的草图化图像来规避人工标注。它采用共享特征提取、类别特定专家、用于动态路由的路由器,以及将2D姿态估计作为辅助任务,实现了在多个数据集和未见类别上的部件分割、姿态估计和草图描述生成方面的最先进性能。

ABSTRACT

The ability to semantically interpret hand-drawn line sketches, although very challenging, can pave way for novel applications in multimedia. We propose SketchParse, the first deep-network architecture for fully automatic parsing of freehand object sketches. SketchParse is configured as a two-level fully convolutional network. The first level contains shared layers common to all object categories. The second level contains a number of expert sub-networks. Each expert specializes in parsing sketches from object categories which contain structurally similar parts. Effectively, the two-level configuration enables our architecture to scale up efficiently as additional categories are added. We introduce a router layer which (i) relays sketch features from shared layers to the correct expert (ii) eliminates the need to manually specify object category during inference. To bypass laborious part-level annotation, we sketchify photos from semantic object-part image datasets and use them for training. Our architecture also incorporates object pose prediction as a novel auxiliary task which boosts overall performance while providing supplementary information regarding the sketch. We demonstrate SketchParse's abilities (i) on two challenging large-scale sketch datasets (ii) in parsing unseen, semantically related object categories (iii) in improving fine-grained sketch-based image retrieval. As a novel application, we also outline how SketchParse's output can be used to generate caption-style descriptions for hand-drawn sketches.

研究动机与目标

  • 实现对多样化物体类别中手绘草图的完全自动解析,并具备细粒度的语义理解能力。
  • 克服因绘制技能差异导致的稀疏且低质量草图所带来的高变异性挑战。
  • 通过使用现有部件标注图像数据集中的草图化图像,消除对昂贵的手动部件级草图标注的需求。
  • 通过将2D姿态估计作为辅助任务,提升草图理解能力。
  • 支持新型应用,如草图描述生成和细粒度的基于草图的图像检索。

提出的方法

  • 该模型采用两级全卷积架构:所有类别共享的主干网络,以及针对结构相似的超类别(如鸟类和飞机)的专家子网络。
  • 一个路由器网络根据预测的超类别,动态地将共享主干层的特征路由到相应的专家网络,从而在推理阶段无需手动指定类别。
  • 训练数据通过将现有语义部件检测数据集中的图像进行草图化处理生成,保留部件级标注的同时将图像转换为类似草图的表示形式。
  • 网络通过端到端训练,采用结合部件分割和2D姿态估计的多任务损失函数,以提升泛化能力和性能。
  • 采用基于图的重排序方法,利用部件级解析结果和姿态信息,在草图与图像之间匹配部件图,以提升基于草图的图像检索性能。
  • 通过模板填充方法生成草图描述,利用类别路由器、部件解析器和姿态网络的输出结果。

实验结果

研究问题

  • RQ1具有共享主干和专家子网络的深层层次化网络能否有效解析多种物体类别中的手绘草图?
  • RQ2来自部件标注图像数据集的草图化图像能否作为训练阶段替代人工标注草图数据集的可行方案?
  • RQ3将2D姿态估计作为辅助任务是否能提升草图部件分割的性能?
  • RQ4该模型能否在无需微调的情况下泛化到未见过的、语义相关的物体类别?
  • RQ5解析后的草图特征能否用于生成丰富且描述性的草图文字说明?

主要发现

  • SketchParse 在两个大规模草图数据集上实现了最先进性能,展现出在多样化物体类别中的强大泛化能力。
  • 通过在图匹配重排序框架中引入部件级解析和姿态信息,模型显著提升了细粒度的基于草图的图像检索性能。
  • 将2D姿态估计作为辅助任务显著提升了部件分割的准确率,表明多任务学习的有效性。
  • 路由器机制实现了推理阶段的自动类别推断,无需手动输入类别信息。
  • 该模型成功利用解析出的部件、姿态和类别信息,生成了详细且类似描述的草图文字说明。
  • 该方法在未见过的、语义相关的类别上表现出良好的泛化能力,展示了其可扩展性和鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。