Skip to main content
QUICK REVIEW

[论文解读] Making Online Sketching Hashing Even Faster

Xixian Chen, Haiqin Yang|arXiv (Cornell University)|Oct 10, 2020
Advanced Image and Video Retrieval Techniques参考文献 57被引用 7
一句话总结

本文提出FROSH(Fastest Online Sketching Hashing)及其分布式变体DFROSH,以加速在线压缩哈希,实现单次遍历、低内存的流数据处理。通过独立变换对数据进行紧凑压缩,FROSH在相同内存预算下实现了与OSH相当的压缩精度,同时训练速度最高提升300倍——在FLICKR-25600等大规模数据集上,训练时间从数分钟缩短至数秒。

ABSTRACT

Data-dependent hashing methods have demonstrated good performance in various machine learning applications to learn a low-dimensional representation from the original data. However, they still suffer from several obstacles: First, most of existing hashing methods are trained in a batch mode, yielding inefficiency for training streaming data. Second, the computational cost and the memory consumption increase extraordinarily in the big data setting, which perplexes the training procedure. Third, the lack of labeled data hinders the improvement of the model performance. To address these difficulties, we utilize online sketching hashing (OSH) and present a FasteR Online Sketching Hashing (FROSH) algorithm to sketch the data in a more compact form via an independent transformation. We provide theoretical justification to guarantee that our proposed FROSH consumes less time and achieves a comparable sketching precision under the same memory cost of OSH. We also extend FROSH to its distributed implementation, namely DFROSH, to further reduce the training time cost of FROSH while deriving the theoretical bound of the sketching precision. Finally, we conduct extensive experiments on both synthetic and real datasets to demonstrate the attractive merits of FROSH and DFROSH.

研究动机与目标

  • 解决批量训练哈希方法在流数据与大数据场景下的效率低下问题。
  • 降低高维数据处理中的计算成本与内存消耗。
  • 克服现有在线哈希方法在训练速度与可扩展性方面的局限。
  • 为在线与分布式变体提供压缩精度的理论保证。
  • 实现实时、分布式及流数据处理场景下哈希技术的实际部署。

提出的方法

  • 提出FROSH,一种在线压缩哈希算法,通过独立变换将数据压缩为紧凑形式。
  • 理论分析证明,FROSH在相同内存预算下可保持与OSH相当的压缩精度。
  • 提出DFROSH,作为FROSH的分布式扩展,支持多台机器并行处理数据。
  • 采用压缩大小ℓ = 2r,其中r为编码长度,以平衡精度与效率。
  • 在实验中设定m = 4d用于FROSH与DFROSH,并将数据在DFROSH中均匀分配至五台机器。
  • 利用基于SVD的近似与低秩矩阵分解,在最小化计算量的同时保持精度。

实验结果

研究问题

  • RQ1是否能在不牺牲压缩精度的前提下,显著提升在线压缩哈希的训练速度?
  • RQ2在相同内存约束下,所提出的FROSH算法与OSH相比,在训练时间与精度方面表现如何?
  • RQ3FROSH的分布式实现(即DFROSH)是否能进一步加速训练,同时保持精度的理论边界?
  • RQ4FROSH在高维真实数据集(如FLICKR-25600)上的表现如何,相较于批量训练方法?
  • RQ5在不同编码长度(32、64、128位)下,训练效率与准确率之间的权衡关系如何?

主要发现

  • FROSH将训练时间缩短至OSH的1/20至1/10,CIFAR-10上32位编码仅需0.63秒,FLICKR-25600上为72秒。
  • DFROSH相较批量训练的OCH实现最高300倍加速,FLICKR-25600上训练时间从5000秒以上降至30秒以内。
  • FROSH与DFROSH在MAP得分上与OSH相当,甚至在FLICKR-25600上优于OCH,表明其在高维数据上具备强泛化能力。
  • 精确率-召回率曲线显示,FROSH与DFROSH几乎与OSH重合,证实其检索精度具有竞争力。
  • 在所有数据集上,FROSH与DFROSH随数据流入持续提升MAP得分,表明其对数据漂移具有有效适应能力。
  • 理论分析确认,FROSH与DFROSH在精度边界内保持压缩精度,为其效率-精度权衡提供了理论依据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。