Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Semantic Deep Hashing

Sheng Jin|arXiv (Cornell University)|Mar 19, 2018
Advanced Image and Video Retrieval Techniques参考文献 2被引用数 3
ひとこと要約

本稿では、教師なしの深層ハッシング手法であるUnsupervised Semantic Deep Hashing (USDH) を提案する。この手法は、ラベルなしでVGG-19特徴量からの意味的情報を活用し、バイナリーハッシュコードを学習するエンドツーエンドのアプローチである。4つの損失成分(意味的損失、量子化損失、エントロピー最大化、回転不変性)を強制することで、画像検索および微細分類タスクで最先端の性能を達成し、従来の教師なし手法と比較して最大10.7%の精度向上を達成した。

ABSTRACT

In recent years, deep hashing methods have been proved to be efficient since it employs convolutional neural network to learn features and hashing codes simultaneously. However, these methods are mostly supervised. In real-world application, it is a time-consuming and overloaded task for annotating a large number of images. In this paper, we propose a novel unsupervised deep hashing method for large-scale image retrieval. Our method, namely unsupervised semantic deep hashing ( extbf{USDH}), uses semantic information preserved in the CNN feature layer to guide the training of network. We enforce four criteria on hashing codes learning based on VGG-19 model: 1) preserving relevant information of feature space in hashing space; 2) minimizing quantization loss between binary-like codes and hashing codes; 3) improving the usage of each bit in hashing codes by using maximum information entropy, and 4) invariant to image rotation. Extensive experiments on CIFAR-10, NUSWIDE have demonstrated that extbf{USDH} outperforms several state-of-the-art unsupervised hashing methods for image retrieval. We also conduct experiments on Oxford 17 datasets for fine-grained classification to verify its efficiency for other computer vision tasks.

研究の動機と目的

  • 教師あり深層ハッシングにおける手動アノテーションの高コストを解消するため、教師なしの代替手法を開発すること。
  • クラスラベルに依存せずに、深層特徴から得られる意味的類似性をハッシングコード空間に保持すること。
  • 量子化損失、情報エントロピー最大化、回転不変性の強制により、ハッシングコードの品質を向上させること。
  • 画像検索を越えて、微細分類タスクなどにおける有効性を実証すること。

提案手法

  • VGG-19ネットワークのミドルレベル特徴量を意味的記述子として用い、ハッシングコードの学習をガイドする。
  • 特徴記述子から計算された類似性関係を保つように、ハッシングコードが促進される意味的損失を導入する。
  • 実数値コードとそのバイナリ近似との差を最小化するため、量子化損失を適用する。
  • ハッシングコードの各ビットの情報エントロピーを最大化することで、バランスの取れた効果的なビット使用を確保する。
  • 元の画像と回転させた画像のハッシングコード間の距離を最小化することで、回転不変性を強制する。
  • すべての4つの成分を組み合わせた複合損失関数を用いて、ネットワークをエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1深層特徴からの意味的情報を教師なし設定で効果的に活用することで、ハッシングコードの品質を向上させられるか?
  • RQ2回転不変性を強制することで、教師なし深層ハッシングの性能にどのような影響を与えるか?
  • RQ3意味的損失、量子化損失、エントロピー損失、回転不変性損失を組み合わせることで、従来の教師なし手法と比較して検索精度がどの程度向上するか?
  • RQ4ラベルなしで学習された教師なしハッシングコードは、微細分類タスクにおいても有効に機能するか?

主な発見

  • CIFAR-10では、64ビットコードで平均平均精度(MAP)が65.87%を達成し、DeepBitを27.57ポイント上回った。
  • NUSWIDEでは、64ビットコードでMAPが64.07%を達成し、他の教師なしベースラインを顕著に上回った。
  • 意味的損失のみを適用すると、DeepBitと比較して性能が7.62%向上し、さらに量子化損失を追加することで、精度がさらに4.07%向上した。
  • オックスフォード-17の微細分類花データセットでは、81.3%の精度を達成し、DeepBitを6.2%、SIFT-Internalを10.7%上回った。
  • ハイパーパramータの設定に対して頑健であり、意味的損失パラメータρの異なる値でもMAPの変動は0.2%未満にとどまった。
  • 1サンプルあたり0.07秒という高速な推論速度を維持しており、DeepBitと同等であり、従来の手作業で作成された記述子と比べて著しく高速だった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。