Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Supervised Product Quantization for Image Search and Retrieval

Benjamin Klein, Lior Wolf|arXiv (Cornell University)|Nov 23, 2017
Advanced Image and Video Retrieval Techniques参考文献 34被引用数 7
ひとこと要約

本稿では、非教師付きのプロダクト量子化(PQ)を拡張し、ストレートスルー推定器を用いてソフトおよびハードなバイナリコードの両方を学習する辞書ベースの表現を用いる、エンドツーエンドの教師ありハッシング手法であるDeep Product Quantization(DPQ)を提案する。DPQは、標準的なPQと同等のメモリおよび推論効率を維持しながら、画像検索および分類ベンチマークで最先端の性能を達成する。

ABSTRACT

Product Quantization, a dictionary based hashing method, is one of the leading unsupervised hashing techniques. While it ignores the labels, it harnesses the features to construct look up tables that can approximate the feature space. In recent years, several works have achieved state of the art results on hashing benchmarks by learning binary representations in a supervised manner. This work presents Deep Product Quantization (DPQ), a technique that leads to more accurate retrieval and classification than the latest state of the art methods, while having similar computational complexity and memory footprint as the Product Quantization method. To our knowledge, this is the first work to introduce a dictionary-based representation that is inspired by Product Quantization and which is learned end-to-end, and thus benefits from the supervised signal. DPQ explicitly learns soft and hard representations to enable an efficient and accurate asymmetric search, by using a straight-through estimator. Our method obtains state of the art results on an extensive array of retrieval and classification experiments.

研究の動機と目的

  • 教師付きのプロダクト量子化(PQ)の限界を克服し、トレーニング中にタスク固有のラベルを統合することで、検索精度を向上させる。
  • ハッシング手法における対称的および非対称的検索の性能差を克服するため、ソフトおよびハード表現の両方を学習する。
  • 従来のPQ手法とは異なり、教師信号の恩恵を受けることのできる、辞書ベースのハッシングシステムのエンドツーエンド学習を可能にする。
  • 新たな正規化技術と共同中心損失関数を用いることで、クロスドメイン検索および分類性能を向上させる。
  • 学習されたコードワードを用いた辞書ベースのアプローチが、効率を保ちながらも最先端のバイナリハッシング手法を上回る精度を達成できることを示す。

提案手法

  • ストレートスルー推定器を用いて、非微分可能なargmax演算によるハード表現を介して勾配をバックプロパゲートする、微分可能でエンドツーエンドの学習可能なプロダクト量子化手法であるDeep Product Quantization(DPQ)を提案する。
  • ハード表現はargmax操作のため微分不能であるが、ストレートスルー推定器を用いて勾配を伝播させる。
  • 特徴表現とそれに対応するクラスタ中心との距離を最小化するとともに、ソフトおよびハードコードの乖離を低減する、共同中心損失関数を導入する。
  • 特徴分布を整えることでゼロショットおよびクロスドメイン検索性能を向上させる正規化技術を適用する。
  • 照合テーブル(LUT)を用いて、圧縮表現間の近似ユークリッド距離を計算し、標準PQと同等の複雑さで高速な非対称検索を実現する。
  • 分類ラベルからの教師信号を用いてエンドツーエンドでモデルを学習し、検索および分類精度の両方を最適化する。

実験結果

リサーチクエスチョン

  • RQ1プロダクト量子化のような辞書ベースのハッシング手法を、エンドツーエンドで教師ありに学習することで、検索精度を向上させることができるか?
  • RQ2エンドツーエンドの教師ありDPQの性能は、対称的および非対称的検索において、最先端のバイナリハッシング手法と比較してどの程度優れているか?
  • RQ3ソフトおよびハード表現の両方を学習することで、検索システムのロバスト性および精度がどの程度向上するか?
  • RQ4共同中心損失関数は、ソフトおよびハード表現の乖離を効果的に低減するとともに、クラスタリング品質を向上させることができるか?
  • RQ5特徴の正規化は、画像検索タスクにおけるクロスドメイン一般化性能を向上させるか?

主な発見

  • 64ビットの圧縮表現を用いてImageNetでトップ1精度56.80%、トップ5精度77.59%を達成し、以前の最先端手法SUBICをそれぞれ9.03%および5.43%上回った。
  • Oxford5KおよびParis6Kベンチマークでは、同じプロトコル下でPQ、LSQ、DSH-64、SUBICを上回り、mAPスコアはそれぞれ0.2643および0.4249を記録した。
  • VOC2007での対称的検索性能(mAP = 0.5530)は、SUBICの対称的結果(mAP = 0.4443)を顕著に上回っており、非対称検索がなくても強力な性能を示している。
  • PQ-Normベースライン(PQに正規化を適用)はDPQとほぼ同等の性能(Oxford5KでのmAP = 0.2646 ± 0.0012)を示し、正規化が性能向上の鍵要因であることを示唆している。
  • DPQは、標準PQと同等のメモリフットプリントおよび推論時間を維持しながら、複数のベンチマークで優れた精度を達成した。
  • 共同中心損失関数と正規化技術は、クロスドメイン検索において顕著に性能を向上させ、本手法のドメインシフトに対するロバスト性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。