Skip to main content
QUICK REVIEW

[论文解读] Sketch Less for More: On-the-Fly Fine-Grained Sketch Based Image Retrieval

Ayan Kumar Bhunia, Yongxin Yang|arXiv (Cornell University)|Feb 24, 2020
Advanced Image and Video Retrieval Techniques参考文献 50被引用 12
一句话总结

该论文提出了一种基于强化学习的实时细粒度草图图像检索(FG-SBIR)框架,通过在整个绘图过程中优化真实图像的排名,实现仅用最少草图笔画即可检索目标照片。该方法引入了一种新颖的奖励机制,结合早期检索与Kendall-Tau排名一致性,实现在两个公开数据集上最先进的早期检索性能,同时具备优异的一致性与对噪声笔画的鲁棒性。

ABSTRACT

Fine-grained sketch-based image retrieval (FG-SBIR) addresses the problem of retrieving a particular photo instance given a user's query sketch. Its widespread applicability is however hindered by the fact that drawing a sketch takes time, and most people struggle to draw a complete and faithful sketch. In this paper, we reformulate the conventional FG-SBIR framework to tackle these challenges, with the ultimate goal of retrieving the target photo with the least number of strokes possible. We further propose an on-the-fly design that starts retrieving as soon as the user starts drawing. To accomplish this, we devise a reinforcement learning-based cross-modal retrieval framework that directly optimizes rank of the ground-truth photo over a complete sketch drawing episode. Additionally, we introduce a novel reward scheme that circumvents the problems related to irrelevant sketch strokes, and thus provides us with a more consistent rank list during the retrieval. We achieve superior early-retrieval efficiency over state-of-the-art methods and alternative baselines on two publicly available fine-grained sketch retrieval datasets.

研究动机与目标

  • 为解决细粒度草图图像检索(FG-SBIR)中的实际障碍,即绘制完整草图所需的时间以及用户难以准确绘制的问题。
  • 将FG-SBIR重新定义为一种实时检索问题,在绘图过程中尽可能早地检索目标照片,以最小化所需笔画数。
  • 开发一种学习框架,即使在草图完成过程中添加了噪声或无关笔画,也能保持一致且准确的照片排名。
  • 通过直接在整个绘图过程中优化真实图像的排名,而非依赖三元组损失或固定嵌入学习,从而提升检索效率与鲁棒性。

提出的方法

  • 该框架采用强化学习(RL)流程,在每次笔画渲染步骤中优化真实图像的排名,最大化整个绘图过程中 1/排名 的总和。
  • 提出一种新颖的奖励函数,包含两个部分:(1) 基于 1/排名 的局部奖励,以鼓励早期检索;(2) 基于归一化Kendall-Tau距离的全局奖励,以确保时间步之间的排名一致性。
  • 模型采用基于CNN的草图编码器,从每个笔画渲染步骤的位图草图图像中生成特征嵌入,实现序列化表示学习。
  • 强化学习中的演员-评论家架构学习一种策略,选择动作(如嵌入更新)以最大化累积奖励,其中评论家估计每个状态的期望回报。
  • 奖励函数对连续排名列表之间的Kendall-Tau距离施加单调递减约束,以稳定训练过程,并减少后期噪声笔画带来的性能下降。
  • 该框架采用非短视、序列感知的端到端优化,考虑完整的绘图轨迹,不同于传统三元组损失将每个草图视为独立样本的做法。

实验结果

研究问题

  • RQ1基于强化学习的框架是否能通过在整个绘图序列中优化真实图像的排名,实现在细粒度草图图像检索中的优越早期检索性能?
  • RQ2如何设计奖励函数以在用户添加噪声或无关笔画时,平衡早期检索与排名一致性?
  • RQ3基于Kendall-Tau距离的全局一致性损失是否能提升对后期绘图阶段排名不一致或退化情况的鲁棒性?
  • RQ4所提出的实时框架与需要完整草图或使用三元组损失训练的传统FG-SBIR模型相比,表现如何?
  • RQ5该模型在笔画顺序和用户绘图行为变化下具备多大程度的鲁棒性?

主要发现

  • 所提方法在Chair-V2数据集上达到85.44%的平均平均精度(m@A),在Shoe-V2数据集上达到85.38%,优于当前最先进基线模型的早期检索效率。
  • 引入全局奖励项后,Chair-V2上的笔画反冲指数从0.0421降至0.0304,Shoe-V2上从0.0451降至0.0337,表明在噪声笔画下排名一致性得到改善。
  • 全局奖励使Chair-V2上的m@A提升1.11%,m@B提升1.31%;Shoe-V2上分别提升0.98%和0.90%,证明其在稳定性能方面的有效性。
  • 使用64维嵌入空间时性能最佳,Chair-V2上m@A为85.44%,Shoe-V2上为85.38%;维度过大或过小均导致性能下降。
  • 将基于CNN的草图编码器替换为基于RNN的序列模型(如LSTM)后,Top-5准确率显著下降至19.62%(Chair-V2)和15.34%(Shoe-V2),表明CNN在位图草图表示方面更具优势。
  • 即使笔画顺序被随机打乱,模型仍保持强劲性能(m@A: 85.04%,m@B: 34.84%),证实其对用户特定绘图模式的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。