Skip to main content
QUICK REVIEW

[论文解读] Sparse similarity-preserving hashing

Jonathan Masci, Alex Bronstein|arXiv (Cornell University)|Dec 19, 2013
Advanced Image and Video Retrieval Techniques参考文献 28被引用 17
一句话总结

本文提出SparseHash,一种新颖的相似性保持哈希方法,通过在二进制哈希码中强制实施稀疏性,在与最先进密集哈希方法相当的精度下实现更高的召回率。通过使用受ISTA启发的前馈神经网络并结合$\boldsymbol{\text{ℓ}}_1$正则化,该方法在保持低误报率和误报率的同时,实现了高效的汉明距离计算,在视觉和多模态检索任务中均优于密集哈希方法。

ABSTRACT

In recent years, a lot of attention has been devoted to efficient nearest neighbor search by means of similarity-preserving hashing. One of the plights of existing hashing techniques is the intrinsic trade-off between performance and computational complexity: while longer hash codes allow for lower false positive rates, it is very difficult to increase the embedding dimensionality without incurring in very high false negatives rates or prohibiting computational costs. In this paper, we propose a way to overcome this limitation by enforcing the hash codes to be sparse. Sparse high-dimensional codes enjoy from the low false positive rates typical of long hashes, while keeping the false negative rates similar to those of a shorter dense hashing scheme with equal number of degrees of freedom. We use a tailored feed-forward neural network for the hashing function. Extensive experimental evaluation involving visual and multi-modal data shows the benefits of the proposed method.

研究动机与目标

  • 通过在哈希码中引入稀疏性,解决相似性保持哈希中性能与计算复杂度之间的权衡。
  • 克服密集哈希的局限性,即长码导致误报率上升和计算成本增加,而短码则降低精度。
  • 开发一种基于神经网络的框架,通过$\boldsymbol{\text{ℓ}}_1$-正则化优化学习稀疏且具有判别性的哈希码。
  • 将该方法扩展至多模态和跨模态检索任务,实现在图像与文本数据之间的联合学习。
  • 证明:在与密集码相同自由度下,稀疏码可实现显著更高的召回率,且不损失精度。

提出的方法

  • 将哈希问题表述为对总误报率和误报率的$\boldsymbol{\text{ℓ}}_1$-正则化最小化,以在哈希码中强制实现稀疏性。
  • 设计一种受迭代软阈值算法(ISTA)启发的前馈神经网络架构,模拟稀疏编码求解器的结构。
  • 使用随机梯度下降进行网络训练,实现大规模数据集的可扩展性。
  • 采用可微分的激活函数,使稀疏编码层能够实现端到端的反向传播。
  • 将网络集成到相似性保持哈希框架中,使输出码保留输入数据的成对相似性。
  • 通过使用统一损失函数将图像和文本联合嵌入共享稀疏二进制空间,将方法扩展至多模态学习。

实验结果

研究问题

  • RQ1与密集哈希相比,在二进制哈希码中强制实施稀疏性是否能提升召回率,同时保持低误报率?
  • RQ2受ISTA算法启发的神经网络架构是否能有效学习用于相似性保持哈希的判别性稀疏码?
  • RQ3在相同自由度下,稀疏哈希是否能实现与最先进密集哈希方法相当或更优的精确率-召回率性能?
  • RQ4该方法在涉及图像与文本的跨模态检索任务中表现如何?
  • RQ5哈希码的稀疏性是否能降低汉明距离计算的计算成本,特别是在非零半径最近邻搜索中?

主要发现

  • 在CIFAR-10数据集上,SparseHash使用256位码时达到84.24%的平均平均精度(mAP),与DH和SSH等最先进方法相当或更优,同时保持了低误报率和误报率。
  • 在NUS-WIDE多模态数据集上,MM-SparseHash在图像到标签检索中达到61.52% mAP,在标签到图像检索中达到59.52% mAP,跨模态召回率优于CM-SSH和AGH。
  • 仅使用64位码时,SparseHash在CIFAR-10上达到74.17% mAP,显著优于相同码长下的密集方法(如DH和SSH)。
  • 与具有相同自由度的密集哈希相比,该方法将误报率和误报率降低了最多50%,尤其在64位码中表现明显。
  • 所提出的网络架构实现了汉明球内高效的部分碰撞检测,相比密集对应方法降低了计算成本。
  • 对检索结果的视觉检查显示,MM-SparseHash即使在原始图像标签中不存在的情况下,也能检索出语义相关的标签,表明其具备强大的语义泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。