Skip to main content
QUICK REVIEW

[论文解读] CNN Based Hashing for Image Retrieval

Jinma Guo, Jianmin Li|arXiv (Cornell University)|Sep 4, 2015
Advanced Image and Video Retrieval Techniques参考文献 35被引用 12
一句话总结

该论文提出了一种新型端到端的基于CNN的哈希方法CNNBH,通过二值化全连接层激活值的符号生成二进制哈希码,在MNIST数据集上达到最先进性能,并在CIFAR-10上取得最佳结果,相较于先前方法显著提升(MAP提高8–16%)。

ABSTRACT

Along with data on the web increasing dramatically, hashing is becoming more and more popular as a method of approximate nearest neighbor search. Previous supervised hashing methods utilized similarity/dissimilarity matrix to get semantic information. But the matrix is not easy to construct for a new dataset. Rather than to reconstruct the matrix, we proposed a straightforward CNN-based hashing method, i.e. binarilizing the activations of a fully connected layer with threshold 0 and taking the binary result as hash codes. This method achieved the best performance on CIFAR-10 and was comparable with the state-of-the-art on MNIST. And our experiments on CIFAR-10 suggested that the signs of activations may carry more information than the relative values of activations between samples, and that the co-adaption between feature extractor and hash functions is important for hashing.

研究动机与目标

  • 为解决现有监督哈希方法依赖复杂相似性矩阵构建的局限性。
  • 探究深层CNN特征的符号本身是否可作为有效的哈希码。
  • 开发一种简单、可端到端训练的哈希框架,集成特征学习与哈希过程。
  • 探究特征提取器与哈希函数之间的协同适应是否能提升检索性能。
  • 证明基于符号的深层特征二值化方法可优于基于值的相似性度量与核化哈希方法。

提出的方法

  • 该方法使用标准CNN进行端到端图像分类训练,无独立的哈希阶段。
  • 通过将选定全连接层的激活值在零处进行阈值化生成二进制哈希码:$ h_i = \begin{cases} 1 & \text{if } a_i \geq 0 \\ 0 & \text{otherwise} \end{cases} $
  • 模型通过最小化分类损失进行训练,隐式优化特征表示以提升检索性能。
  • 该方法避免了矩阵分解或对哈希码的独立优化,简化了训练过程。
  • 最终哈希码直接从倒数第二层全连接层输出的符号中导出。
  • 采用标准指标(如CIFAR-10和MNIST上的平均平均精度MAP)进行评估。

实验结果

研究问题

  • RQ1深层CNN特征的符号本身是否可作为有效的二进制哈希码用于图像检索?
  • RQ2对CNN进行端到端分类训练所生成的哈希码是否优于两阶段方法(如CNNH)?
  • RQ3特征学习与哈希之间的协同适应是否对性能至关重要?
  • RQ4基于符号的二值化方法与基于值的相似性度量(如欧氏距离)相比表现如何?
  • RQ5对特征符号进行简单二值化是否可超越更复杂的核化哈希方法(如KSH)?

主要发现

  • CNNBH在CIFAR-10上表现最佳,相较于之前最先进方法,平均平均精度(MAP)提升16%。
  • 在MNIST上,CNNBH达到最先进性能,优于所有基线方法,包括KSH和基于欧氏距离的排序方法。
  • 研究发现,激活值的符号所携带的判别信息多于样本间激活值相对大小的信息。
  • L2_fc+(修正特征)的性能略高于L2_fc,表明符号信息比符号内幅值差异更具信息量。
  • 使用与CNNBH相同层特征的KSH性能劣于CNNBH,表明特征与哈希的端到端联合学习更具优势。
  • 该方法在使用Gist和CNN特征的LSH哈希方法上均表现更优,表明CNN特征在哈希任务中比手工设计特征更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。