Skip to main content
QUICK REVIEW

[论文解读] Discrete Multi-modal Hashing with Canonical Views for Robust Mobile Landmark Search

Lei Zhu, Zi Huang|arXiv (Cornell University)|Jul 13, 2017
Advanced Image and Video Retrieval Techniques参考文献 52被引用 11
一句话总结

该论文提出了一种用于鲁棒移动地标检索的新型哈希框架——基于规范视图的离散多模态哈希(CV-DMH),通过子模优化发现具有区分性的规范视图,利用这些视图上的多模态稀疏编码来编码视觉内容,并通过带增广拉格朗日乘子法的直接优化学习离散二进制码。CV-DMH通过联合施加离散性、比特不相关性和平衡性约束,在多个数据集上实现了最先进的mAP性能,显著优于现有方法。

ABSTRACT

Mobile landmark search (MLS) recently receives increasing attention for its great practical values. However, it still remains unsolved due to two important challenges. One is high bandwidth consumption of query transmission, and the other is the huge visual variations of query images sent from mobile devices. In this paper, we propose a novel hashing scheme, named as canonical view based discrete multi-modal hashing (CV-DMH), to handle these problems via a novel three-stage learning procedure. First, a submodular function is designed to measure visual representativeness and redundancy of a view set. With it, canonical views, which capture key visual appearances of landmark with limited redundancy, are efficiently discovered with an iterative mining strategy. Second, multi-modal sparse coding is applied to transform visual features from multiple modalities into an intermediate representation. It can robustly and adaptively characterize visual contents of varied landmark images with certain canonical views. Finally, compact binary codes are learned on intermediate representation within a tailored discrete binary embedding model which preserves visual relations of images measured with canonical views and removes the involved noises. In this part, we develop a new augmented Lagrangian multiplier (ALM) based optimization method to directly solve the discrete binary codes. We can not only explicitly deal with the discrete constraint, but also consider the bit-uncorrelated constraint and balance constraint together. Experiments on real world landmark datasets demonstrate the superior performance of CV-DMH over several state-of-the-art methods.

研究动机与目标

  • 为解决移动地标搜索(MLS)中高带宽查询传输和极端视觉差异的挑战。
  • 通过建模地标外观的规范视图,捕捉关键视觉特征并最小化冗余,以提升哈希的鲁棒性和区分能力。
  • 开发一种直接优化二进制码的离散多模态哈希方法,避免‘松弛与舍入’过程中的量化误差。
  • 通过学习紧凑且保持相似性的二进制码,实现高效、低比特的查询传输与快速检索。
  • 将多模态特征(如视觉、上下文)整合到以规范视图为基础的统一表征中,以提升泛化能力。

提出的方法

  • 设计一种子模函数,联合衡量视图集合的视觉代表性与冗余性,实现具有理论保证的最优规范视图迭代挖掘。
  • 多模态稀疏编码将多模态特征转换为中间表征,以鲁棒方式编码相对于规范视图的视觉内容。
  • 提出一种离散二进制嵌入模型,将中间表征映射为紧凑二进制码,通过增广拉格朗日乘子(ALM)方法直接求解离散约束。
  • 基于ALM的优化同时施加三项约束:离散编码、比特不相关性和平衡性,避免了两步松弛方法中常见的量化误差。
  • 基于视觉相似性图构建拉普拉斯矩阵,以在嵌入空间中保留语义关系。
  • 整个框架分为三个阶段:规范视图发现、中间表征学习和离散二进制码优化。

实验结果

研究问题

  • RQ1规范视图——即地标代表性且非冗余的视角——能否作为移动地标搜索中鲁棒多模态哈希的稳定基础?
  • RQ2如何有效编码多模态特征,以相对于规范视图表征地标多样的视觉外观?
  • RQ3与传统的‘松弛与舍入’方法相比,直接对二进制码进行离散优化能否显著提升检索性能?
  • RQ4联合施加离散性、比特不相关性和平衡性约束在多大程度上增强了学习哈希码的区分能力?
  • RQ5所提方法在优化目标的超参数变化下表现是否稳定?

主要发现

  • CV-DMH在三个真实世界地标数据集(Paris5K、Paris14K 和 Paris500k)上实现了卓越的平均平均精度(mAP),优于多种最先进的哈希方法。
  • 消融实验表明,采用ALM的直接离散优化相比松弛离散约束的变体显著提升了性能,验证了避免量化误差的有效性。
  • 该方法对超参数变化具有鲁棒性,在优化目标中α、β和γ的广泛取值范围内均保持稳定的mAP表现。
  • 收敛性分析显示,目标函数值在约7–8轮迭代后下降并趋于稳定,证实了算法的收敛行为。
  • 在所有设置下,CV-DMH的性能始终显著高于CV-DMH-III和CV-DMH-IV,证明了联合施加全部三项约束的必要性。
  • 实验结果表明,即使在短二进制码长度(如128位)下,该方法仍能保持高性能,支持低带宽移动传输。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。