Skip to main content
QUICK REVIEW

[论文解读] Cross-Modal Hierarchical Modelling for Fine-Grained Sketch Based Image Retrieval

Aneeshan Sain, Ayan Kumar Bhunia|arXiv (Cornell University)|Jul 29, 2020
Advanced Image and Video Retrieval Techniques参考文献 58被引用 22
一句话总结

本文提出了一种用于细粒度草图图像检索(FG-SBIR)的跨模态分层建模范式,通过端到端可训练的、Gumbel-Softmax近似化的节点合并方法隐式发现草图层次结构。通过在每一层整合跨模态协同注意力与分层融合,该方法学习到具有判别性的多层次嵌入,在标准基准上显著优于当前最先进方法,在 QMUL-ChairV2 上达到 62.45% 的准确率@1,在 SWIRE 上达到 67.23%。

ABSTRACT

Sketch as an image search query is an ideal alternative to text in capturing the fine-grained visual details. Prior successes on fine-grained sketch-based image retrieval (FG-SBIR) have demonstrated the importance of tackling the unique traits of sketches as opposed to photos, e.g., temporal vs. static, strokes vs. pixels, and abstract vs. pixel-perfect. In this paper, we study a further trait of sketches that has been overlooked to date, that is, they are hierarchical in terms of the levels of detail -- a person typically sketches up to various extents of detail to depict an object. This hierarchical structure is often visually distinct. In this paper, we design a novel network that is capable of cultivating sketch-specific hierarchies and exploiting them to match sketch with photo at corresponding hierarchical levels. In particular, features from a sketch and a photo are enriched using cross-modal co-attention, coupled with hierarchical node fusion at every level to form a better embedding space to conduct retrieval. Experiments on common benchmarks show our method to outperform state-of-the-arts by a significant margin.

研究动机与目标

  • 为解决在细粒度草图图像检索(FG-SBIR)中,自由手绘草图的层次结构尚未被充分探索的问题,其中草图细节从粗略到精细不等。
  • 通过在两种模态中显式建模分层语义结构,减少草图与照片之间的域差距。
  • 通过在每一层实现的跨模态协同注意力与分层融合,提升跨模态嵌入质量。
  • 通过学习可适应部分或不完整草图的层次结构,实现对任意草图细节水平的鲁棒检索。
  • 建立一种新颖的、端到端可训练的框架,无需预定义结构即可发现特定于草图的层次结构。

提出的方法

  • 采用凝聚式合并方案隐式发现草图层次结构,其中节点(特征)被迭代合并以形成更高层次的表示。
  • 应用直通Gumbel-Softmax操作近似离散的合并决策,从而实现对不可微的节点选择过程的反向传播。
  • 引入一种跨模态协同注意力模块,实现在每一层次上草图与照片特征之间的相互注意力。
  • 采用门控机制自适应融合来自两种模态的协同注意力特征,过滤掉不匹配或噪声部分。
  • 在每一层执行分层节点融合,将优化后的特征在各层间传播,形成最终嵌入。
  • 在共享嵌入空间中使用基于距离的排序进行检索,经验证优于标量相似性预测。

实验结果

研究问题

  • RQ1隐式的、端到端可学习的草图层次结构是否能提升细粒度草图图像检索的性能?
  • RQ2在多个分层级别上应用跨模态协同注意力如何增强草图与照片特征之间的对齐?
  • RQ3结合协同注意力的分层融合是否能在不同草图细节水平(如不完整草图)下实现更鲁棒的检索?
  • RQ4与显式层次建模或非层次基线方法相比,所提方法在准确率和鲁棒性方面表现如何?
  • RQ5在照片分支中,协同注意力的最优区域数(k)是多少?其对准确率和推理时间有何影响?

主要发现

  • 所提方法在 QMUL-ChairV2 上达到 62.45% 的准确率@1,在 SWIRE 上达到 67.23%,显著优于当前最先进方法。
  • 移除跨模态协同注意力(w/o Localised-Coattn)后,QMUL-ChairV2 上性能下降 10.6%,QMUL-ShoeV2 上下降 4.45%,证明其关键作用。
  • 移除层次建模(w/o Hierarchy)后,QMUL-ChairV2 上性能下降 7.21%,QMUL-ShoeV2 上下降 3.06%,验证了层次结构的重要性。
  • 模型在不完整草图上仍保持强鲁棒性:当 50% 的线条被移除时,QMUL-ChairV2 上的 acc.@10 仍保持在 87.58%,QMUL-ShoeV2 上为 85.64%。
  • 显式层次建模(SWIRE 上为 71.54%)作为上限,表明隐式层次发现模块达到了上限性能的 94.5%。
  • 协同注意力的最优区域数(k)为 16,兼顾准确率与推理时间;增加 k 会提高时间成本,减少 k 则损害准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。