Skip to main content
QUICK REVIEW

[论文解读] Query by Semantic Sketch

Luca Rossetto, Ralph Gasser|arXiv (Cornell University)|Sep 27, 2019
Advanced Image and Video Retrieval Techniques参考文献 33被引用 5
一句话总结

本文提出了一种基于草图的视觉检索方法,允许用户通过在二维画布上绘制语义概念(如“天空”或“人物”)的空间分布来查询多媒体集合。通过使用从深度神经网络生成的概念图以及预训练词嵌入导出的紧凑向量表示,该方法支持基于kNN的高效检索,显著节省存储空间,且无需专用索引结构。

ABSTRACT

Sketch-based query formulation is very common in image and video retrieval as these techniques often complement textual retrieval methods that are based on either manual or machine generated annotations. In this paper, we present a retrieval approach that allows to query visual media collections by sketching concept maps, thereby merging sketch-based retrieval with the search for semantic labels. Users can draw a spatial distribution of different concept labels, such as "sky", "sea" or "person" and then use these sketches to find images or video scenes that exhibit a similar distribution of these concepts. Hence, this approach does not only take the semantic concepts themselves into account, but also their semantic relations as well as their spatial context. The efficient vector representation enables efficient retrieval even in large multimedia collections. We have integrated the semantic sketch query mode into our retrieval engine vitrivr and demonstrated its effectiveness.

研究动机与目标

  • 解决传统基于文本和低级特征的图像检索在大规模多媒体集合中的局限性。
  • 通过结合概念的语义意义和空间关系,克服草图检索的挑战。
  • 通过使用紧凑向量表示,实现在无需专用索引结构情况下的高效可扩展检索。
  • 支持无需重新训练现有神经网络即可动态添加新的语义类别。
  • 在大规模视频数据集(V3C1)上,利用vitrivr检索引擎展示该方法的可行性和性能。

提出的方法

  • 使用深度神经网络从输入图像生成概念图,以像素级检测语义概念(如“人物”、“天空”)。
  • 使用预训练的word2vec嵌入表示每个语义概念,并通过t-SNE投影到低维空间以实现紧凑性。
  • 通过将图像划分为网格(如8×8、16×16、32×32)并计算每个网格单元的平均嵌入来聚合空间信息。
  • 构建大小为$ n^2 d $的最终向量表示,其中$ n $为网格尺寸,$ d $为语义嵌入的维度。
  • 通过允许用户在二维画布上使用颜色编码标签绘制概念分布来支持查询构建,这些草图随后被转换到相同的向量空间。
  • 通过在紧凑向量表示上使用曼哈顿(L1)距离度量进行kNN查找来执行检索。

实验结果

研究问题

  • RQ1紧凑向量表示能否有效编码语义概念及其空间分布,以实现高效的基于草图的检索?
  • RQ2与先前方法相比,该方法在大规模多媒体集合中的存储效率和检索性能如何?
  • RQ3在不重新训练现有神经网络的情况下,能够多大程度上动态添加新的语义类别?
  • RQ4与仅依赖孤立概念检测的方法相比,结合空间和语义关系是否能提高检索准确性?
  • RQ5即使在大规模场景下,该方法能否在无需专用索引结构的情况下实现快速检索?

主要发现

  • 所提方法的存储需求可降低至基准方法([8]中所述)的4.2%,具体取决于配置参数。
  • 在包含1,046,235个向量的V3C1数据集上,朴素线性kNN查找的平均耗时为974毫秒,证明其适用于交互式应用。
  • 由于使用了预计算的词嵌入,该方法可在不重新训练现有神经网络分类器的情况下实现新语义类别的动态添加。
  • 向量表示同时保留了概念之间的语义相似性及其空间布局,从而实现更准确、更具上下文感知的检索。
  • 该方法仅通过标准kNN与L1距离即可实现高效检索,无需依赖专用索引结构。
  • 该方法已成功集成至vitrivr检索引擎,并在公开实地测试中得到验证,确认其实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。