[论文解读] More Photos are All You Need: Semi-Supervised Learning for Fine-Grained Sketch Based Image Retrieval
本文提出了一种新颖的半监督框架,用于细粒度草图图像检索(FG-SBIR),通过利用大规模未标注照片生成伪草图-图像对,在标注数据有限的情况下提升了检索性能。通过联合训练图像到草图生成器与检索模型,并结合判别器引导的实例加权和知识蒸馏,该方法实现了最先进性能,在 QMUL-ShoeV2 数据集上将 Acc@1 提升了 8.0%。
A fundamental challenge faced by existing Fine-Grained Sketch-Based Image Retrieval (FG-SBIR) models is the data scarcity -- model performances are largely bottlenecked by the lack of sketch-photo pairs. Whilst the number of photos can be easily scaled, each corresponding sketch still needs to be individually produced. In this paper, we aim to mitigate such an upper-bound on sketch data, and study whether unlabelled photos alone (of which they are many) can be cultivated for performances gain. In particular, we introduce a novel semi-supervised framework for cross-modal retrieval that can additionally leverage large-scale unlabelled photos to account for data scarcity. At the centre of our semi-supervision design is a sequential photo-to-sketch generation model that aims to generate paired sketches for unlabelled photos. Importantly, we further introduce a discriminator guided mechanism to guide against unfaithful generation, together with a distillation loss based regularizer to provide tolerance against noisy training samples. Last but not least, we treat generation and retrieval as two conjugate problems, where a joint learning procedure is devised for each module to mutually benefit from each other. Extensive experiments show that our semi-supervised model yields significant performance boost over the state-of-the-art supervised alternatives, as well as existing methods that can exploit unlabelled photos for FG-SBIR.
研究动机与目标
- 解决细粒度草图图像检索(FG-SBIR)中的关键数据稀缺问题,即标注的草图-图像对数量有限且收集成本高昂。
- 探究是否可利用大规模未标注照片(可轻松获取数百万张)来提升 FG-SBIR 性能,而无需依赖成对的草图。
- 开发一种联合学习框架,使草图生成与检索通过反馈信号相互促进。
- 通过引入可靠性评分与噪声容忍机制,克服草图生成中噪声与不忠实的问题。
- 设计一种可微分的端到端训练流程,整合生成与检索任务,并采用策略梯度强化学习实现反馈。
提出的方法
- 提出一种序列化的图像到草图生成器,保留空间分辨率,并引入跨模态 2D 注意力机制,从未标注图像中生成高保真、细粒度的草图。
- 引入一个判别器(D_C),用于评估生成的草图-图像对的可靠性,输出置信度分数,用于在检索训练过程中对三元组损失进行实例加权。
- 基于相对教师-学生框架引入知识蒸馏损失,以正则化检索模型,提升对噪声合成样本的容忍度。
- 采用策略梯度强化学习方案,将来自检索模型与判别器的奖励反向传播至生成器,实现从检索质量到生成保真度的反馈。
- 实施生成器与检索模型的联合训练,其中检索模型通过反馈信号指导生成器,而生成器通过增强的训练数据提升检索性能。
- 通过蒸馏引入一致性损失,以稳定训练过程并减少对噪声伪标签的过拟合。

实验结果
研究问题
- RQ1当配对草图数据稀缺时,仅使用未标注照片是否能显著提升 FG-SBIR 性能?
- RQ2在训练过程中,如何过滤掉不可靠或不忠实的草图生成结果,以防止性能下降?
- RQ3与顺序或独立训练相比,草图生成与检索之间的联合学习在多大程度上能同时提升两个任务的性能?
- RQ4基于判别器置信度的实例加权在提升检索鲁棒性方面起到何种作用?
- RQ5来自检索模型的策略梯度反馈在提升合成草图-图像对质量方面的有效性如何?
主要发现
- 所提出的半监督框架在 QMUL-ShoeV2 数据集上实现了 39.1% 的 Acc@1,相比监督基线模型提升了 8.0%。
- 移除判别器引导的实例加权后,Acc@1 降至 36.8%,证实其在过滤低质量合成对中的关键作用。
- 知识蒸馏降低了对噪声的敏感性,当移除时 Acc@1 下降 1.8%;相对蒸馏方法相比绝对蒸馏方法表现更优,提升 0.9%。
- 生成器中的 2D 注意力机制提升了草图质量,当替换为 1D 注意力时,Acc@1 下降 4.2%(至 8.1%)。
- 通过策略梯度反馈实现的联合训练使检索准确率提升 1.4%,优于单独使用检索或判别器反馈的效果。
- 该框架在训练数据有限时仍保持优异性能,在不同数据规模下均显著优于监督基线模型。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。