[论文解读] End-to-End Supervised Product Quantization for Image Search and Retrieval
本文提出深度产品量化(DPQ),一种端到端的监督哈希方法,通过使用直通估计器学习基于字典的表示,结合软编码与硬编码,扩展了无监督产品量化(PQ)。DPQ在图像检索与分类基准上达到最先进性能,同时保持与标准PQ相同的内存占用与推理效率。
Product Quantization, a dictionary based hashing method, is one of the leading unsupervised hashing techniques. While it ignores the labels, it harnesses the features to construct look up tables that can approximate the feature space. In recent years, several works have achieved state of the art results on hashing benchmarks by learning binary representations in a supervised manner. This work presents Deep Product Quantization (DPQ), a technique that leads to more accurate retrieval and classification than the latest state of the art methods, while having similar computational complexity and memory footprint as the Product Quantization method. To our knowledge, this is the first work to introduce a dictionary-based representation that is inspired by Product Quantization and which is learned end-to-end, and thus benefits from the supervised signal. DPQ explicitly learns soft and hard representations to enable an efficient and accurate asymmetric search, by using a straight-through estimator. Our method obtains state of the art results on an extensive array of retrieval and classification experiments.
研究动机与目标
- 通过在训练过程中引入任务特定标签,解决无监督产品量化(PQ)的局限性,以提升检索准确率。
- 通过学习软表示与硬表示,弥合哈希方法中对称与非对称检索之间的性能差距。
- 实现基于字典的哈希系统端到端训练,利用监督信号,这与以往PQ方法不同。
- 通过一种新颖的归一化技术与联合中心损失函数,提升跨域检索与分类性能。
- 证明基于学习码书的字典方法可在保持效率的同时,超越当前最先进二值哈希方法的准确率。
提出的方法
- 提出深度产品量化(DPQ),一种可微分的、端到端学习的产品量化方法,使用共享编码器生成软表示与硬表示。
- 采用直通估计器,通过非可微的argmax操作反向传播梯度至硬表示。
- 引入联合中心损失函数,最小化特征表示与其对应聚类中心之间的距离,同时减少软码与硬码之间的差异。
- 应用归一化技术,通过对齐特征分布,提升零样本与跨域检索性能。
- 使用查找表(LUT)计算压缩表示之间的近似欧氏距离,实现与标准PQ相同复杂度的快速非对称检索。
- 使用分类标签的监督信号端到端训练模型,同时优化检索与分类准确率。
实验结果
研究问题
- RQ1能否以端到端监督方式训练基于字典的哈希方法(如产品量化),以提升检索准确率?
- RQ2在对称与非对称检索方面,端到端监督DPQ相较于当前最先进二值哈希方法的性能表现如何?
- RQ3同时学习软表示与硬表示在多大程度上提升了检索系统的鲁棒性与准确率?
- RQ4联合中心损失函数能否有效缩小软表示与硬表示之间的差距,同时提升聚类质量?
- RQ5特征归一化是否能增强图像检索任务中的跨域泛化能力?
主要发现
- 在使用64位压缩表示的情况下,DPQ在ImageNet上的top-1准确率为56.80%,top-5准确率为77.59%,分别超越先前SOTA方法SUBIC 9.03%与5.43%。
- 在Oxford5K与Paris6K基准上,DPQ的mAP分别为0.2643与0.4249,优于相同协议下的PQ、LSQ、DSH-64与SUBIC。
- DPQ在VOC2007上的对称检索性能(mAP = 0.5530)显著优于SUBIC的对称结果(mAP = 0.4443),表明其在无需非对称检索的情况下也具备强大性能。
- PQ-Norm基线方法(对PQ应用归一化)的性能几乎与DPQ相当(在Oxford5K上mAP = 0.2646 ± 0.0012),表明归一化是性能提升的关键因素。
- DPQ保持与标准PQ相同的内存占用与推理时间,同时在多个基准上实现更优的准确率。
- 联合中心损失函数与归一化技术显著提升了跨域检索性能,证明了该方法对域偏移的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。