Skip to main content
QUICK REVIEW

[论文解读] Auto-Encoding Twin-Bottleneck Hashing

Yuming Shen, Jie Qin|arXiv (Cornell University)|Feb 27, 2020
Advanced Image and Video Retrieval Techniques参考文献 48被引用 5
一句话总结

本文提出了一种新型无监督哈希框架——孪生瓶颈哈希(Twin-Bottleneck Hashing, TBH),通过具有双瓶颈的生成自编码架构,联合优化二值码学习与自适应图构建。通过使用二值码动态构建基于汉明距离的相似性图,并利用连续潜在变量实现高保真重建,TBH 在不放松二值约束的前提下实现了图像检索的最先进性能,支持通过随机梯度下降进行端到端训练。

ABSTRACT

Conventional unsupervised hashing methods usually take advantage of similarity graphs, which are either pre-computed in the high-dimensional space or obtained from random anchor points. On the one hand, existing methods uncouple the procedures of hash function learning and graph construction. On the other hand, graphs empirically built upon original data could introduce biased prior knowledge of data relevance, leading to sub-optimal retrieval performance. In this paper, we tackle the above problems by proposing an efficient and adaptive code-driven graph, which is updated by decoding in the context of an auto-encoder. Specifically, we introduce into our framework twin bottlenecks (i.e., latent variables) that exchange crucial information collaboratively. One bottleneck (i.e., binary codes) conveys the high-level intrinsic data structure captured by the code-driven graph to the other (i.e., continuous variables for low-level detail information), which in turn propagates the updated network feedback for the encoder to learn more discriminative binary codes. The auto-encoding learning objective literally rewards the code-driven graph to learn an optimal encoder. Moreover, the proposed model can be simply optimized by gradient descent without violating the binary constraints. Experiments on benchmarked datasets clearly show the superiority of our framework over the state-of-the-art hashing methods. Our source code can be found at https://github.com/ymcidence/TBH.

研究动机与目标

  • 为解决无监督哈希中的‘静态图’问题,即预计算或基于锚点的相似性图引入了有偏的先验知识,从而限制性能提升。
  • 解决生成式哈希中的‘缺陷二值瓶颈’(deficient BinBN)问题,即直接从二值瓶颈解码导致重建质量差。
  • 将哈希函数学习与图构建统一为单一可端到端训练的框架,避免交替优化或松弛技术。
  • 在不违反二值约束的前提下,通过梯度估计实现对二值变量的基于梯度的优化,确保使用标准SGD进行实际训练。

提出的方法

  • TBH采用具有二值瓶颈(BinBN)和连续瓶颈(ConBN)的孪生瓶颈自编码器架构,其中BinBN用于判别性码学习,ConBN用于高容量重建。
  • 通过式(4)直接利用二值码之间的汉明距离构建代码驱动图,实现自适应、数据相关的相似性建模。
  • 应用图卷积网络(GCNs)将来自BinBN的图信息传播至ConBN,增强特征表示学习。
  • 重建损失通过ConBN计算,相比直接从二值码解码,能保留更多熵,从而提升解码质量。
  • 采用分布导数估计器,实现梯度通过离散二值瓶颈的反向传播,支持端到端训练,无需松弛或交替优化。
  • 整体损失函数结合了自编码、对抗性和图正则化项,通过标准随机梯度下降(SGD)进行优化。

实验结果

研究问题

  • RQ1自适应的、代码驱动的相似性图是否能通过替代静态或预计算图,提升无监督哈希性能?
  • RQ2孪生瓶颈架构是否能有效解决生成式哈希模型中的‘缺陷二值瓶颈’(deficient BinBN)问题?
  • RQ3是否可以在不放松二值约束的前提下,通过离散变量的梯度估计实现二值码的端到端训练?
  • RQ4与传统交替优化或松弛方法相比,代码学习与图构建的联合优化在性能上表现如何?

主要发现

  • TBH在基准数据集上达到最先进性能,优于现有无监督哈希方法在图像检索任务中的表现。
  • 移除自适应代码驱动图(baseline_6)导致性能下降约9%,证实其在建模数据结构中的关键作用。
  • 与单瓶颈基线相比,孪生瓶颈设计显著降低了重建误差,验证了其在缓解‘缺陷二值瓶颈’问题上的有效性。
  • 模型在不同超参数设置下保持鲁棒,即使瓶颈维度L降低至64,性能下降也极小。
  • 定性结果表明,代码驱动图能紧密模拟基于标签的相似性,t-SNE可视化显示类别间分离清晰,语义相似的类别在汉明空间中距离更近。
  • 在MNIST上的图像重建结果表明,TBH比SGH更好地保留了图像细节,且重建数字的误分类更少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。