Skip to main content
QUICK REVIEW

[論文レビュー] Making Online Sketching Hashing Even Faster

Xixian Chen, Haiqin Yang|arXiv (Cornell University)|Oct 10, 2020
Advanced Image and Video Retrieval Techniques参考文献 57被引用数 7
ひとこと要約

本稿では、ストリーミングデータのシングルパスかつ低メモリ処理を可能にする、オンラインスケッチハッシュの高速化を目的としたFROSH(Fastest Online Sketching Hashing)およびその分散版DFROSHを提案する。FROSHは、データをコン act にスケッチするために独立した変換を適用することで、同じメモリ予算下でOSHと同等のスケッチ精度を達成しつつ、最大300倍高速な学習を実現。FLICKR-25600などの大規模データセットでは、学習時間を数分から数秒に短縮した。

ABSTRACT

Data-dependent hashing methods have demonstrated good performance in various machine learning applications to learn a low-dimensional representation from the original data. However, they still suffer from several obstacles: First, most of existing hashing methods are trained in a batch mode, yielding inefficiency for training streaming data. Second, the computational cost and the memory consumption increase extraordinarily in the big data setting, which perplexes the training procedure. Third, the lack of labeled data hinders the improvement of the model performance. To address these difficulties, we utilize online sketching hashing (OSH) and present a FasteR Online Sketching Hashing (FROSH) algorithm to sketch the data in a more compact form via an independent transformation. We provide theoretical justification to guarantee that our proposed FROSH consumes less time and achieves a comparable sketching precision under the same memory cost of OSH. We also extend FROSH to its distributed implementation, namely DFROSH, to further reduce the training time cost of FROSH while deriving the theoretical bound of the sketching precision. Finally, we conduct extensive experiments on both synthetic and real datasets to demonstrate the attractive merits of FROSH and DFROSH.

研究の動機と目的

  • ストリーミングおよびビッグデータ環境におけるバッチ学習ハッシュ手法の非効率性を解消する。
  • 高次元データ処理における計算コストとメモリ消費量を低減する。
  • 従来のオンラインハッシュ手法が抱える学習速度およびスケーラビリティの限界を克服する。
  • オンラインおよび分散バージョンに対してスケッチ精度に関する理論的保証を提供する。
  • リアルタイム、分散型、ストリーミングデータ処理アプリケーションにおけるハッシュの実用的導入を可能にする。

提案手法

  • データをコンパクトにスケッチするための独立した変換を用いるオンラインスケッチハッシュアルゴリズムFROSHを提案する。
  • 理論的分析により、FROSHが同じメモリ予算下でOSHと同等のスケッチ精度を維持することを証明する。
  • FROSHの分散拡張版であるDFROSHを導入し、複数のマシンで並列にデータ処理を行う。
  • 精度と効率のバランスを図るため、スケッチサイズℓをℓ = 2r(rはコード長)として設定する。
  • FROSHおよびDFROSHの実験的設定として、m = 4dを採用し、DFROSHではデータを5台のマシンに均等に分散する。
  • 精度を維持しながら計算量を最小限に抑えるために、SVDに基づく近似および低ランク行列分解を活用する。

実験結果

リサーチクエスチョン

  • RQ1スケッチ精度を損なわずに、オンラインスケッチハッシュを著しく高速化できるか?
  • RQ2同じメモリ制約下で、FROSHはOSHと比較して学習時間と精度の点でどのように異なるか?
  • RQ3FROSHの分散実装(DFROSH)は、精度の理論的境界を保ちながら、さらに学習を高速化できるか?
  • RQ4FROSHは、FLICKR-25600などの高次元で実世界のデータセットにおいて、バッチ学習手法と比較してどのように性能を発揮するか?
  • RQ5コード長(32ビット、64ビット、128ビット)を変更した場合、学習効率と精度のトレードオフはどのように変化するか?

主な発見

  • FROSHはOSHの学習時間を1/20から1/10に短縮し、CIFAR-10では32ビットコードで0.63秒、FLICKR-25600では72秒を達成した。
  • DFROSHはバッチ学習のOCHに対して最大300倍の高速化を達成し、FLICKR-25600では学習時間を5,000秒以上から30秒未満に短縮した。
  • FROSHおよびDFROSHは、OSHと同等のMAPスコアを維持しており、FLICKR-25600ではOCHを上回ることも示され、高次元データにおける優れた一般化性能を示した。
  • 再現率-適合率曲線では、FROSHおよびDFROSHがOSHとほぼ重複しており、同等の検索精度を有することを確認した。
  • すべてのデータセットにおいて、FROSHおよびDFROSHは流入するデータに応じてMAPスコアを一貫して向上させ、データドリフトへの効果的な適応を示した。
  • 理論的分析により、FROSHおよびDFROSHがスケッチ精度を境界内に維持していることが確認され、その効率性と精度のトレードオフが正当化された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。