Skip to main content
QUICK REVIEW

[論文レビュー] Deep Hashing: A Joint Approach for Image Signature Learning

Yadong Mu, Zhu Liu|arXiv (Cornell University)|Aug 12, 2016
Advanced Image and Video Retrieval Techniques参考文献 27被引用数 6
ひとこと要約

本論文は、統一されたニューラルネットワークを用いて、深層特徴抽出と非線形の教師ありハッシングを同時に最適化する統合学習フレームワーク「Deep Hashing」を提案する。微分可能な指数関数的ハッシング損失関数と2段階の教師あり事前学習戦略を導入することで、エンド・ツー・エンドの勾配ベース最適化を可能にし、最先端の性能を達成した—MNISTでは12ビットで0.99のハミングランク精度、CIFAR10では0.74を記録し、従来手法を大幅に上回った。

ABSTRACT

Similarity-based image hashing represents crucial technique for visual data storage reduction and expedited image search. Conventional hashing schemes typically feed hand-crafted features into hash functions, which separates the procedures of feature extraction and hash function learning. In this paper, we propose a novel algorithm that concurrently performs feature engineering and non-linear supervised hashing function learning. Our technical contributions in this paper are two-folds: 1) deep network optimization is often achieved by gradient propagation, which critically requires a smooth objective function. The discrete nature of hash codes makes them not amenable for gradient-based optimization. To address this issue, we propose an exponentiated hashing loss function and its bilinear smooth approximation. Effective gradient calculation and propagation are thereby enabled; 2) pre-training is an important trick in supervised deep learning. The impact of pre-training on the hash code quality has never been discussed in current deep hashing literature. We propose a pre-training scheme inspired by recent advance in deep network based image classification, and experimentally demonstrate its effectiveness. Comprehensive quantitative evaluations are conducted on several widely-used image benchmarks. On all benchmarks, our proposed deep hashing algorithm outperforms all state-of-the-art competitors by significant margins. In particular, our algorithm achieves a near-perfect 0.99 in terms of Hamming ranking accuracy with only 12 bits on MNIST, and a new record of 0.74 on the CIFAR10 dataset. In comparison, the best accuracies obtained on CIFAR10 by existing hashing algorithms without or with deep networks are known to be 0.36 and 0.58 respectively.

研究の動機と目的

  • 従来のハッシング手法が特徴抽出とハッシュ関数学習を別々の段階として扱うという制限を解決すること。
  • 離散的ハッシュコードの非微分性という課題を克服し、ハッシングのための深層ニューラルネットワークのエンド・ツー・エンド学習を可能にすること。
  • 限られた教師情報のもとで大規模データセットにおけるハッシュコードの品質を向上させること、特に過小サンプリング条件下での性能向上を目的とすること。
  • 事前学習が深層ハッシング性能に与える影響を調査すること—これは従来の文献では未解決のギャップであった。

提案手法

  • 勾配逆伝播を可能にするために、双線形スムーズ関数による近似を用いる微分可能な指数関数的ハッシング損失関数を提案する。
  • ImageNet事前学習を模倣した2段階の教師あり事前学習スキームを導入し、共同最適化の前にラベル付きデータからの知識を用いてネットワーク重みを初期化する。
  • 共有層と最終的なハッシング層を備えた深層ニューラルネットワークアーキテクチャを用い、すべてのパラメータを確率的勾配降下法で共同微調整する。
  • ミニバッチ学習と学習率の段階的減少戦略を適用し、エンド・ツー・エンド最適化中の収束を安定化させる。
  • 指数損失の双線形近似を用いることで、滑らかな勾配を維持しながらも、ハッシュコードの離散性を保ったままにする。
  • 比較評価のため、手作業で設計された特徴(例:GIST、DenseSIFT)と学習されたCNN特徴を両方とも使用する。

実験結果

リサーチクエスチョン

  • RQ1特徴抽出とハッシュ関数学習を逐次的に行う従来手法と比較して、深層特徴とハッシュ関数の統合学習がハッシング性能を向上させられるか?
  • RQ2深層ネットワークにおける勾配ベース最適化と整合性を持つように、ハッシュコードの離散的性質をどのように扱えるか?
  • RQ3教師あり事前学習が、深層ハッシングにおける学習済みハッシュコードの品質に与える影響は何か?
  • RQ4手作業特徴と学習特徴の両方を用いた場合、深層ハッシングの性能は最先端手法と比べてどの程度優れているか?

主な発見

  • 提案されたDeep Hashing手法は、12ビットでMNISTにおいて0.99のハミングランク精度を達成し、従来手法を著しく上回った。
  • CIFAR10データセットでは、0.74という新たな最先端の精度を達成し、従来の最高水準(0.58)を大幅に上回った。
  • 事前学習なしのランダム初期化でも、事前学習ベースラインを上回る性能を示しており、分離された事前学習よりも統合最適化の利点が明確に示された。
  • 教師あり事前学習 followed by ファインチューニングが、すべてのデータセットで最も安定した性能を示し、特にSUN397のような高カテゴリ数の困難なデータセットで顕著だった。
  • 手作業特徴とCNN特徴の間には顕著な性能差があり、CIFAR10およびSUN397の両方でCNN特徴のmAPスコアは手作業特徴の2〜3倍にのぼった。
  • 特徴学習とハッシングの共同最適化は、特徴とハッシュコードを別々に学習する2段階的手法よりも優れた結果をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。