[论文解读] Learning Hash Codes via Hamming Distance Targets
本文提出了一种新颖的损失函数——汉明距离目标(HDT),通过使用对数似然损失建模两个输入落在目标汉明距离内的概率,从而提升二值哈希码的学习效果。该方法采用高效的小批量样本配对策略与多索引技术,实现快速检索,在 ImageNet 上达到 84% 的 MAP,在 SIFT-1M 上实现 12,709 次距离比较下 78.1% 的召回率,性能优于以往方法,查询效率最高提升 8 倍。
We present a powerful new loss function and training scheme for learning binary hash codes with any differentiable model and similarity function. Our loss function improves over prior methods by using log likelihood loss on top of an accurate approximation for the probability that two inputs fall within a Hamming distance target. Our novel training scheme obtains a good estimate of the true gradient by better sampling inputs and evaluating loss terms between all pairs of inputs in each minibatch. To fully leverage the resulting hashes, we use multi-indexing. We demonstrate that these techniques provide large improvements to a similarity search tasks. We report the best results to date on competitive information retrieval tasks for ImageNet and SIFT 1M, improving MAP from 73% to 84% and reducing query cost by a factor of 2-8, respectively.
研究动机与目标
- 为解决数据到结果哈希方法在相似性搜索中表现不佳的问题,通过改进二值哈希码学习的训练信号。
- 开发一种可微分的、通用的损失函数,用于建模两个输入处于目标汉明距离内的概率。
- 在保持或提升召回率的同时,通过更优的哈希码学习与多索引技术,降低近似最近邻搜索的查询成本。
- 在 ImageNet 和 SIFT-1M 等竞争性基准上,通过端到端学习的哈希码实现最先进性能。
提出的方法
- HDT 损失函数使用两个输入落在汉明距离目标范围内的概率的对数似然,通过基于 Sigmoid 的模型对预二值化输出分布进行近似。
- 训练方案通过在每个小批量内采样所有输入对并计算它们之间的损失项,从而改善梯度估计。
- 该方法兼容任意可微模型与相似度函数,支持神经网络在二值哈希任务上的端到端训练。
- 采用多索引技术高效检索目标汉明距离范围内的结果,实现快速且可扩展的相似性搜索。
- 模型使用温度调度的 Sigmoid 函数,促使输出收敛至 ±1,提升二值化稳定性。
- 超参数如汉明距离目标(r)、误报损失比率(λ)和哈希位长(n)经过调优,以优化召回率与查询成本。
实验结果
研究问题
- RQ1一种可微分的损失函数,若能建模汉明距离接近的概率,是否可提升二值哈希码的学习效果?
- RQ2通过在小批量中计算完整成对损失项,实现更优的梯度估计,是否能提升哈希任务的泛化能力?
- RQ3HDT 是否能在 ImageNet 和 SIFT-1M 等标准基准上实现最先进性能,同时降低查询成本?
- RQ4为何 HDT 在较短哈希长度下表现更优,这与‘更长哈希始终优于更短哈希’的预期相悖?
- RQ5对汉明距离概率的统计建模,与交叉熵或 L2 量化损失等标准损失函数相比有何差异?
主要发现
- 在 ImageNet 上,HDT 在 16 位下达到 83.8% 的 MAP,相比次优方法绝对提升 10.5%,报告的 84% MAP 为当前最佳结果。
- 在 SIFT-1M 上,HDT-E 在 12,709 次距离比较下实现 78.1% 的召回率,优于产品量化(PQ)方法,后者需 101,158 次比较才能达到 74.4% 的召回率。
- 与先前方法相比,HDT 在 SIFT-1M 上将查询成本降低 2–8 倍,并在 ImageNet 上将 MAP 提升 11 个百分点。
- 即使在高召回率区间,HDT 的召回率也优于 PQ,证明其在效率与有效性上的卓越表现。
- HDT 在低比特长度(如 16 位)下表现优异,表明其具有高表示效率,且在更长长度下可能存在过拟合风险。
- 多索引技术使 HDT 能够在目标汉明距离范围内实现快速检索,使其适用于大规模实际应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。