Skip to main content
QUICK REVIEW

[论文解读] A Deep Hashing Learning Network

Guoqiang Zhong, Yang Pan|arXiv (Cornell University)|Jul 16, 2015
Advanced Image and Video Retrieval Techniques参考文献 26被引用 4
一句话总结

本文提出一种深度哈希学习网络,通过使用有监督的深度卷积神经网络,联合优化特征表示与二进制哈希码生成。通过在损失函数前引入一个紧凑的Sigmoid层,模型端到端地学习判别性特征与最优哈希码,在MNIST和CIFAR-10上分别实现了32位下0.995和0.736的mAP得分,达到当前最先进性能。

ABSTRACT

Hashing-based methods seek compact and efficient binary codes that preserve the neighborhood structure in the original data space. For most existing hashing methods, an image is first encoded as a vector of hand-crafted visual feature, followed by a hash projection and quantization step to get the compact binary vector. Most of the hand-crafted features just encode the low-level information of the input, the feature may not preserve the semantic similarities of images pairs. Meanwhile, the hashing function learning process is independent with the feature representation, so the feature may not be optimal for the hashing projection. In this paper, we propose a supervised hashing method based on a well designed deep convolutional neural network, which tries to learn hashing code and compact representations of data simultaneously. The proposed model learn the binary codes by adding a compact sigmoid layer before the loss layer. Experiments on several image data sets show that the proposed model outperforms other state-of-the-art methods.

研究动机与目标

  • 为解决手工设计特征在保留图像检索语义相似性方面的局限性。
  • 克服现有方法中特征与哈希函数学习解耦的问题,该问题导致表示性能次优。
  • 开发一种端到端的深度学习框架,联合优化特征学习与哈希码生成。
  • 在实现紧凑二进制码与低计算成本的同时,实现大规模相似性搜索的高检索准确率。

提出的方法

  • 使用深度卷积神经网络自动学习分层图像表示,而非依赖GIST或BoF等手工设计特征。
  • 在损失层之前插入Sigmoid激活层,直接从网络最终特征生成紧凑的二进制哈希码。
  • 使用有监督标签以端到端方式训练模型,使哈希码学习能为特征学习提供反馈。
  • 损失函数设计用于通过最小化原始空间与汉明空间距离之间的差异来保留语义相似性。
  • 网络架构包含三个带有ReLU激活的卷积层,随后是最大池化层,最后是用于二进制码输出的Sigmoid层。
  • 使用Caffe框架进行训练,输入图像直接以像素值馈入,避免外部特征提取。

实验结果

研究问题

  • RQ1端到端深度学习能否联合优化特征表示与哈希码生成,从而提升图像检索性能?
  • RQ2用CNN学习到的特征替代手工设计特征,是否能提升哈希码中的语义保留能力?
  • RQ3在平均平均精度与召回率方面,所提方法与当前最先进哈希方法相比表现如何?
  • RQ4使用Sigmoid层实现二进制输出的简单CNN架构,是否能优于复杂的两阶段方法?
  • RQ5在训练过程中使用图像标签,对所学习哈希码与特征表示的质量有何影响?

主要发现

  • 在MNIST数据集上,该方法在32位下实现了0.995的平均平均精度(mAP),显著优于次佳方法(CNNH)的0.2%。
  • 在CIFAR-10上,该方法在32位下实现了0.736的mAP,相比当前最先进方法提升18%至27%。
  • 该方法在CIFAR-10上48位时,相比无监督方法如PCA-ITQ和LSH,mAP提升超过30%。
  • 即使采用简单的CNN架构,该方法仍保持高性能,表明使用更深或更复杂的模型可进一步提升性能。
  • 精确率-召回率曲线与精确率-前k名结果均证实,该方法在两个数据集的所有评估指标上均保持一致的优越性。
  • 端到端训练机制实现了特征学习与哈希之间的有效反馈,相比解耦方法具有更好的语义保留能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。