Skip to main content
QUICK REVIEW

[論文レビュー] A Deep Hashing Learning Network

Guoqiang Zhong, Yang Pan|arXiv (Cornell University)|Jul 16, 2015
Advanced Image and Video Retrieval Techniques参考文献 26被引用数 4
ひとこと要約

本稿では、教師あり深層畳み込みニューラルネットワークを用いて特徴表現とバイナリーハッシュコード生成を統合的に最適化する深層ハッシング学習ネットワークを提案する。損失関数の直前にコンパクトなシグモイド層を統合することで、モデルはエンドツーエンドで判別性の高い特徴と最適なハッシュコードを学習可能となり、MNISTおよびCIFAR-10でそれぞれ0.995および0.736のmAPスコアを達成し、最先端の性能を実現した。

ABSTRACT

Hashing-based methods seek compact and efficient binary codes that preserve the neighborhood structure in the original data space. For most existing hashing methods, an image is first encoded as a vector of hand-crafted visual feature, followed by a hash projection and quantization step to get the compact binary vector. Most of the hand-crafted features just encode the low-level information of the input, the feature may not preserve the semantic similarities of images pairs. Meanwhile, the hashing function learning process is independent with the feature representation, so the feature may not be optimal for the hashing projection. In this paper, we propose a supervised hashing method based on a well designed deep convolutional neural network, which tries to learn hashing code and compact representations of data simultaneously. The proposed model learn the binary codes by adding a compact sigmoid layer before the loss layer. Experiments on several image data sets show that the proposed model outperforms other state-of-the-art methods.

研究の動機と目的

  • 画像検索における意味的類似性を保持するためのハンドクラフト特徴量の限界を解消すること。
  • 従来の手法で特徴量とハッシュ関数が分離して学習されることにより生じる最適でない表現を克服すること。
  • 特徴学習とハッシュコード生成を統合的に最適化するエンドツーエンドの深層学習フレームワークを構築すること。
  • 大規模な類似性検索において、コンパクトなバイナリーコードと低コストな計算量で高い検索精度を達成すること。

提案手法

  • GIST や BoF のようなハンドクラフト特徴量に依存せず、階層的な画像表現を自動で学習する深層畳み込みニューラルネットワークを用いる。
  • ネットワークの最終特徴量から直接コンパクトなバイナリーハッシュコードを生成するために、損失層の直前にシグモイド活性化層を挿入する。
  • 教師ありラベルを用いてエンドツーエンドで訓練することで、ハッシュコード学習が特徴学習にフィードバックを提供可能となる。
  • 損失関数は、元の距離とハミング距離空間の差を最小化することで意味的類似性を保持するように設計されている。
  • ネットワークアーキテクチャは、ReLU活性化を伴う3層の畳み込み層、その後にマックスプーリング、最後にバイナリーコード出力用のシグモイド層を配置する。
  • 入力画像をピクセル値そのままで直接入力し、外部特徴抽出を回避する。Caffeフレームワークを用いて訓練を実施する。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドの深層学習が、特徴表現とハッシュコード生成を統合的に最適化することで、画像検索性能の向上を達成できるか?
  • RQ2CNNからの学習特徴量にハンドクラフト特徴量を置き換えることで、ハッシュコードにおける意味的保存性が向上するか?
  • RQ3本手法は、平均平均精度(mAP)と再現率の観点から、最先端のハッシング手法と比較してどのように差をつけるか?
  • RQ4シグモイド層を用いた単純なCNNアーキテクチャが、複雑な2段階手法に比べて優れた性能を発揮できるか?
  • RQ5トレーニング中に画像ラベルを使用することで、学習されたハッシュコードおよび特徴表現の質にどのような影響を与えるか?

主な発見

  • MNISTでは32ビットで平均平均精度(mAP)が0.995を達成し、次に優れた手法(CNNH)を0.2%上回った。
  • CIFAR-10では32ビットでmAPが0.736を達成し、最先端手法に対して18%~27%の改善を示した。
  • PCA-ITQ や LSH などの非教師あり手法と比較して、48ビットのCIFAR-10でmAPが30%以上も向上した。
  • シンプルなCNNアーキテクチャでも高い性能を維持しており、より深く複雑なモデルを用いることでさらなる性能向上が期待できる。
  • 精度-再現率曲線および精度 vs. top-k 結果から、両データセットにおいてすべての評価指標で一貫した優位性が確認された。
  • エンドツーエンドの訓練スキームにより、特徴学習とハッシングの間で効果的なフィードバックが可能となり、分離学習手法に比べて意味的類似性の保存が優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。