[论文解读] Efficient Cross-Modal Retrieval via Deep Binary Hashing and Quantization
本文提出HQ,一种深度学习框架,联合学习二值哈希码和量化码,以实现高效的跨模态检索。通过采用两阶段检索策略——首先利用二值码的汉明距离进行候选过滤,再通过量化距离进行重排序——该方法在保持与纯量化方法相当的O(n)加速比的同时,相比最先进模型实现了超过7%的精度提升。
Cross-modal retrieval aims to search for data with similar semantic meanings across different content modalities. However, cross-modal retrieval requires huge amounts of storage and retrieval time since it needs to process data in multiple modalities. Existing works focused on learning single-source compact features such as binary hash codes that preserve similarities between different modalities. In this work, we propose a jointly learned deep hashing and quantization network (HQ) for cross-modal retrieval. We simultaneously learn binary hash codes and quantization codes to preserve semantic information in multiple modalities by an end-to-end deep learning architecture. At the retrieval step, binary hashing is used to retrieve a subset of items from the search space, then quantization is used to re-rank the retrieved items. We theoretically and empirically show that this two-stage retrieval approach provides faster retrieval results while preserving accuracy. Experimental results on the NUS-WIDE, MIR-Flickr, and Amazon datasets demonstrate that HQ achieves boosts of more than 7% in precision compared to supervised neural network-based compact coding models.
研究动机与目标
- 解决跨多种模态(如图像、文本和音频)进行跨模态检索时存储和计算成本过高的问题。
- 通过联合学习二值哈希码和量化码,克服单一码方法的局限性——即二值哈希(快速但精度较低)和量化(精度高但速度慢)之间的权衡。
- 设计一个两阶段检索流水线,利用二值哈希实现快速候选过滤,利用量化实现精确重排序。
- 通过端到端联合学习紧凑码,实现更高的检索精度并降低计算成本。
- 证明同时学习二值码和量化码可优于顺序学习或正则化替代方案。
提出的方法
- 提出一种端到端的深度神经网络,联合优化多模态数据的二值哈希码和量化码。
- 使用二值码之间的汉明距离作为第一阶段过滤器,大幅减少搜索空间。
- 在第二阶段应用量化距离(例如,量化向量与码书条目之间的L1或L2范数)对过滤后的候选进行重排序。
- 通过共享特征编码器和共享损失函数,将两种码类型集成,以保持跨模态语义相似性。
- 采用可学习的码书进行量化,其中每个数据点被分配一个二值码,指示其最近的词典条目。
- 模型通过对比损失进行端到端训练,该损失鼓励跨模态中语义相似的样本具有相似的码。
实验结果
研究问题
- RQ1与单独使用任一码类型相比,联合学习二值哈希码和量化码是否能提升跨模态检索的精度?
- RQ2采用二值哈希进行过滤、量化进行重排序的两阶段检索流水线,是否相比单阶段方法能实现更好的速度-精度权衡?
- RQ3与分别训练或单独正则化相比,同时学习两种码是否表现更优?
- RQ4通过二值哈希检索的候选数量与后续基于量化重排序的精度之间,最优平衡点在哪里?
- RQ5与现有基于量化的方法相比,所提出的HQ框架在降低检索时间的同时,能否保持或提升精度?
主要发现
- 在NUS-WIDE、MIR-Flickr和Amazon数据集上,HQ相比监督神经网络驱动的紧凑编码模型,在均平均精度(MAP@50)上实现了超过7%的精度提升。
- 采用二值哈希后接量化重排序的两阶段检索策略,其精度高于仅使用二值码或仅使用量化码的方案。
- 当α(通过二值哈希检索的候选比例)设置在0.1–0.3或0.6–0.8之间时,模型在精度与速度之间实现了最佳平衡。
- HQ的检索时间随输入特征维度n线性增长,与CDQ(仅量化)方法相比实现了O(n)加速比,同时保持相同的内存占用和精度。
- 联合学习二值码和量化码优于分别训练两者(如C+D模型),表明两种码类型之间能更有效地共享信息。
- 采用L1或L2正则化的基于量化的模型性能低于HQ,证实联合优化比正则化作为码交互的代理更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。