Skip to main content
QUICK REVIEW

[论文解读] A Zero-Shot Framework for Sketch-based Image Retrieval

Sasi Kiran Yelamarthi, Shiva Krishna Reddy|arXiv (Cornell University)|Jul 31, 2018
Advanced Image and Video Retrieval Techniques参考文献 5被引用 9
一句话总结

本文提出了一种零样本草图图像检索(ZS-SBIR)框架,以解决现有SBIR模型学习类别特定映射而非基于形状对齐的局限性。通过在测试时使用包含未见类别的Sketchy数据集构建基准,并采用条件变分自编码器(CVAE)和条件对抗自编码器(CAAE)进行生成式草图到图像的转换,作者表明生成式模型在零样本泛化方面显著优于判别式基线模型,在CVAE下实现了0.333的精确率。

ABSTRACT

Sketch-based image retrieval (SBIR) is the task of retrieving images from a natural image database that correspond to a given hand-drawn sketch. Ideally, an SBIR model should learn to associate components in the sketch (say, feet, tail, etc.) with the corresponding components in the image having similar shape characteristics. However, current evaluation methods simply focus only on coarse-grained evaluation where the focus is on retrieving images which belong to the same class as the sketch but not necessarily having the same shape characteristics as in the sketch. As a result, existing methods simply learn to associate sketches with classes seen during training and hence fail to generalize to unseen classes. In this paper, we propose a new benchmark for zero-shot SBIR where the model is evaluated in novel classes that are not seen during training. We show through extensive experiments that existing models for SBIR that are trained in a discriminative setting learn only class specific mappings and fail to generalize to the proposed zero-shot setting. To circumvent this, we propose a generative approach for the SBIR task by proposing deep conditional generative models that take the sketch as an input and fill the missing information stochastically. Experiments on this new benchmark created from the "Sketchy" dataset, which is a large-scale database of sketch-photo pairs demonstrate that the performance of these generative models is significantly better than several state-of-the-art approaches in the proposed zero-shot framework of the coarse-grained SBIR task.

研究动机与目标

  • 为解决当前SBIR评估中的缺陷,该缺陷因粗粒度的、基于类别的检索指标而鼓励学习类别特定的表示。
  • 提出一种真实的零样本设置,其中模型在训练期间未见过的新类别上进行测试,以促进超越类别标签的泛化能力。
  • 通过精心划分Sketchy数据集,构建一个新基准,以支持SBIR模型的零样本评估。
  • 证明生成式模型能够学习草图与图像之间的有意义的基于形状的对齐,从而提升零样本泛化能力。
  • 表明条件生成模型(CVAE、CAAE)在所提出的零样本设置下优于最先进判别式SBIR模型。

提出的方法

  • 通过将Sketchy数据集划分为已见类别和未见类别,提出一种零样本SBIR基准,确保训练与测试类别之间无重叠。
  • 将条件变分自编码器(CVAE)和条件对抗自编码器(CAAE)适配为在潜在空间中从草图输入生成图像特征。
  • 使用重建损失和对抗训练来训练模型,以鼓励从草图生成真实且多样的图像。
  • 利用生成的图像特征从数据库中检索图像,通过平均精确率在k位(mP@k)评估性能。
  • 将相同的生成框架应用于零样本图像分类任务,证明其更广泛的应用潜力。
  • 使用自动、无需人工的指标评估模型,以避免偏差和耗时的人工标注。

实验结果

研究问题

  • RQ1当在零样本设置下评估时,现有SBIR模型能否泛化到未见类别?
  • RQ2与判别式模型相比,SBIR的生成式方法是否能带来更好的零样本泛化性能?
  • RQ3条件生成模型是否能在未见过相同类别的情况下,学习到草图与图像之间有意义的基于形状的对齐?
  • RQ4重建损失和对抗训练如何影响生成式SBIR模型在零样本设置下的性能?
  • RQ5所提出的框架能否扩展到草图检索以外的其他零样本学习任务?

主要发现

  • 在判别式设置下训练的现有SBIR模型在零样本设置下表现较差,直接回归的精确率降至0.066,表明存在强烈的类别特定学习倾向。
  • 所提出的CVAE模型在ZS-SBIR基准中实现了0.333的平均精确率,显著优于所有先前的最先进方法。
  • CAAE模型实现了0.260的精确率,表明带有对抗训练的生成模型有效,但其稳定性不如CVAE。
  • CVAE模型表现出更平稳的训练收敛过程,并在使用重建损失时精确率提升了3%,凸显其训练稳定性。
  • 定性结果表明,检索到的图像与草图轮廓高度匹配,且误报通常具有合理的形状相似性,表明对齐学习具有鲁棒性。
  • 通过t-SNE进行的特征可视化证实,生成的特征接近真实图像特征,并能捕捉分布的多个模式,表明潜在空间建模有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。