Skip to main content
QUICK REVIEW

[论文解读] SketchyScene: Richly-Annotated Scene Sketches

Changqing Zou, Qian Yu|arXiv (Cornell University)|Aug 7, 2018
Advanced Vision and Imaging参考文献 28被引用 6
一句话总结

本文提出了 SketchyScene,这是首个大规模、丰富标注的场景素描数据集,包含超过 29,000 幅场景素描、11,000 幅物体素描以及 7,000 多对素描-照片配对,均配有完整的语义掩码和实例掩码。该数据集通过一种新颖的众包流水线创建,利用参考图像引导拖放物体素描,实现了高质量、多样化的场景素描生成。主要贡献在于推动了基于素描的场景理解新应用的发展,包括语义分割、图像检索、着色、编辑和字幕生成,并在使用领域自适应模型进行素描分割方面达到了最先进性能。

ABSTRACT

We contribute the first large-scale dataset of scene sketches, SketchyScene, with the goal of advancing research on sketch understanding at both the object and scene level. The dataset is created through a novel and carefully designed crowdsourcing pipeline, enabling users to efficiently generate large quantities of realistic and diverse scene sketches. SketchyScene contains more than 29,000 scene-level sketches, 7,000+ pairs of scene templates and photos, and 11,000+ object sketches. All objects in the scene sketches have ground-truth semantic and instance masks. The dataset is also highly scalable and extensible, easily allowing augmenting and/or changing scene composition. We demonstrate the potential impact of SketchyScene by training new computational models for semantic segmentation of scene sketches and showing how the new dataset enables several applications including image retrieval, sketch colorization, editing, and captioning, etc. The dataset and code can be found at https://github.com/SketchyScene/SketchyScene.

研究动机与目标

  • 为解决在物体和场景两个层面缺乏大规模、丰富标注的场景素描理解数据集的问题。
  • 开发一种可扩展且可扩展的众包流水线,以实现高效、高质量的逼真且多样的场景素描生成。
  • 通过统一的、带标注的数据集,促进基于素描的图像检索、语义分割、着色、编辑和字幕生成的研究。
  • 研究自然图像分割模型向素描数据的迁移能力,并识别有效的预训练策略。

提出的方法

  • 设计了一种新颖的众包界面,允许用户通过拖放和缩放预存在的物体素描到场景模板上,并在参考图像的引导下创建场景素描。
  • 每幅场景素描均对所有物体进行了语义掩码和实例掩码标注,确保在 45 个常见类别中的精确定位与标注。
  • 该数据集具有模块化和可扩展性,允许在模板中替换物体素描,以生成新构图并丰富数据集。
  • 在 SketchyScene 上微调了 DeepLab-v2 模型,以实现场景素描的语义分割,并通过消融研究评估了在 ImageNet、COCO 和边缘图上进行预训练策略的效果。
  • 基于 InceptionV3 训练了一个三元组排序网络,用于基于素描的图像检索,并引入辅助 Sigmoid 交叉熵损失以利用物体类别信息。
  • 利用分割结果和实例级标注,展示了素描字幕生成、编辑、着色和动态场景合成等应用。

实验结果

研究问题

  • RQ1大规模、丰富标注的场景素描数据集是否能显著提升素描理解任务(如语义分割和图像检索)的性能?
  • RQ2在素描数据上微调时,来自自然图像或边缘图的预训练模型效果如何?哪种预训练策略能取得最佳性能?
  • RQ3SketchyScene 在多大程度上能够支持素描着色、编辑和动态场景合成等新应用?
  • RQ4SketchyScene 的模块化、面向对象的设计在多大程度上支持未来数据集扩展的可扩展性和可扩展性?

主要发现

  • 在 ImageNet 或 COCO 上进行预训练无法提升素描分割性能,因为自然图像与素描之间存在较大的领域差距。
  • 即使使用基于区域的掩码,仅在边缘图上进行预训练也无法获得比从零开始训练更好的结果,因为边缘图中包含手绘素描中不存在的过多噪声。
  • 最佳性能通过在仅包含边界像素的边缘图上进行预训练(变体-3)实现,其最接近目标素描领域,优于其他变体。
  • 基于 SketchyScene 的图像检索在 rank 1 达到 32.13% 的准确率,在 rank 10 达到 69.48%,证明了该数据集在检索任务中的实用性。
  • 利用分割结果和实例级标注,成功演示了素描字幕生成和编辑,实现了如将“chicken”替换为“duck”等语义编辑。
  • 通过基于语义标签分配颜色,实现了自动素描着色,在合成流水线中实现了动态场景序列的连贯着色结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。