Skip to main content
QUICK REVIEW

[论文解读] Deep Cross-Modal Hashing with Hashing Functions and Unified Hash Codes Jointly Learning

Rong-Cheng Tu, Xian-Ling Mao|arXiv (Cornell University)|Jul 29, 2019
Advanced Image and Video Retrieval Techniques参考文献 39被引用 5
一句话总结

本文提出DCHUC,一种新颖的端到端深度跨模态哈希方法,联合学习数据库中图像-文本对的统一哈希码以及未见查询的模态特定哈希函数。通过在两者之间迭代优化并引入反馈机制,DCHUC在三个公开数据集上实现了最先进的检索性能,同时训练速度更快,对超参数选择更具鲁棒性。

ABSTRACT

Due to their high retrieval efficiency and low storage cost, cross-modal hashing methods have attracted considerable attention. Generally, compared with shallow cross-modal hashing methods, deep cross-modal hashing methods can achieve a more satisfactory performance by integrating feature learning and hash codes optimizing into a same framework. However, most existing deep cross-modal hashing methods either cannot learn a unified hash code for the two correlated data-points of different modalities in a database instance or cannot guide the learning of unified hash codes by the feedback of hashing function learning procedure, to enhance the retrieval accuracy. To address the issues above, in this paper, we propose a novel end-to-end Deep Cross-Modal Hashing with Hashing Functions and Unified Hash Codes Jointly Learning (DCHUC). Specifically, by an iterative optimization algorithm, DCHUC jointly learns unified hash codes for image-text pairs in a database and a pair of hash functions for unseen query image-text pairs. With the iterative optimization algorithm, the learned unified hash codes can be used to guide the hashing function learning procedure; Meanwhile, the learned hashing functions can feedback to guide the unified hash codes optimizing procedure. Extensive experiments on three public datasets demonstrate that the proposed method outperforms the state-of-the-art cross-modal hashing methods.

研究动机与目标

  • 解决现有深度跨模态哈希方法在数据库中无法为相关联的图像-文本对学习统一哈希码的局限性。
  • 克服先前方法中统一哈希码学习与哈希函数优化之间缺乏双向反馈的问题。
  • 构建一个端到端框架,联合优化统一哈希码与模态特定哈希函数,以提升检索准确率。
  • 通过受ADSH启发的非对称采样方案,降低大规模数据库的训练时间复杂度。
  • 通过关键参数的广泛敏感性分析,确保方法对超参数变化的鲁棒性。

提出的方法

  • 提出一种迭代优化算法,交替优化数据库实例的统一哈希码与未见查询的哈希函数。
  • 引入联合目标函数,结合哈希损失(以保持模态间与模态内相似性)与分类损失(以增强语义可分性)。
  • 采用非对称采样策略:从n个数据库实例中选取m个锚点实例(m ≪ n),将训练复杂度降低至O(mn)。
  • 构建非对称亲和矩阵,同时监督哈希函数学习与统一哈希码优化。
  • 实现端到端训练流程,其中统一哈希码指导哈希函数学习,而哈希函数通过反馈进一步优化统一哈希码。
  • 通过整个网络进行反向传播,联合优化框架中所有参数。

实验结果

研究问题

  • RQ1在端到端深度哈希框架中,能否有效学习数据库中图像-文本对的统一哈希码?
  • RQ2所学习的哈希函数反馈是否能提升统一哈希码优化的质量?
  • RQ3所提方法能否在检索准确率上超越当前最先进的跨模态哈希基线方法?
  • RQ4非对称采样方案在不牺牲检索性能的前提下,如何影响训练效率?
  • RQ5在实际应用中,该方法对超参数设置的敏感性如何?

主要发现

  • DCHUC在三个公开数据集(MIRFLICKR-25K、IAPR TC-12、NUS-WIDE)上均达到最先进性能,在I2T与T2I检索任务中均优于现有方法。
  • 在NUS-WIDE数据集上,DCHUC的检索性能优于SOTA方法SSAH,尤其在平均精度(MAP)方面表现更优。
  • 目标函数在10次迭代内收敛,且I→T与T→I检索任务的MAP值随目标函数值减小而稳定提升。
  • DCHUC训练速度显著快于SSAH与DCMH,在IAPR TC-12、MIRFLICKR-25K与NUS-WIDE(32位哈希码)上的训练时间分别为11.8秒、12.9秒与28.2秒,而CMDVH分别为16.3秒、21.2秒与39.2秒。
  • 该方法对超参数变化具有鲁棒性:在α、γ、η(1–600)、β(10⁻³–10)与μ(1–600)的广泛范围内,DCHUC均保持高性能,且MAP值稳定。
  • 在精确率-召回率分析中,DCHUC在高召回率(如0.9)下仍保持高精确率,优于MIRFLICKR-25K与NUS-WIDE上的基线方法,表明在汉明空间中相似样本对的紧凑性更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。