Skip to main content
QUICK REVIEW

[論文レビュー] Image Hashing by Minimizing Discrete Component-wise Wasserstein Distance

Khoa D. Doan, Saurav Manchanda|arXiv (Cornell University)|Feb 29, 2020
Advanced Image and Video Retrieval Techniques参考文献 33被引用数 4
ひとこと要約

本稿では、より汎用性の高い成分別バーレルシュタイン距離の変種を最小化する、画像ハッシングのための新規な対抗的オートエンコーダーである離散的成分別 Wasserstein オートエンコーダー(DCW-AE)を提案する。ハッシュコードの離散的性質を活用することで、DCW-AE は著しく優れたサンプル複雑性と計算効率を達成し、既存手法と比較して最大10%の向上を示す最先端のリtrieval性能を実現する。

ABSTRACT

Image hashing is one of the fundamental problems that demand both efficient and effective solutions for various practical scenarios. Adversarial autoencoders are shown to be able to implicitly learn a robust, locality-preserving hash function that generates balanced and high-quality hash codes. However, the existing adversarial hashing methods are inefficient to be employed for large-scale image retrieval applications. Specifically, they require an exponential number of samples to be able to generate optimal hash codes and a significantly high computational cost to train. In this paper, we show that the high sample-complexity requirement often results in sub-optimal retrieval performance of the adversarial hashing methods. To address this challenge, we propose a new adversarial-autoencoder hashing approach that has a much lower sample requirement and computational cost. Specifically, by exploiting the desired properties of the hash function in the low-dimensional, discrete space, our method efficiently estimates a better variant of Wasserstein distance by averaging a set of easy-to-compute one-dimensional Wasserstein distances. The resulting hashing approach has an order-of-magnitude better sample complexity, thus better generalization property, compared to the other adversarial hashing methods. In addition, the computational cost is significantly reduced using our approach. We conduct experiments on several real-world datasets and show that the proposed method outperforms the competing hashing methods, achieving up to 10% improvement over the current state-of-the-art image hashing methods. The code accompanying this paper is available on Github (https://github.com/khoadoan/adversarial-hashing).

研究の動機と目的

  • 既存の対抗的オートエンコーダーに基づくハッシング手法における一般化性能の低さと高い計算コストを是正すること。
  • 画像ハッシングにおけるバーレルシュタインベースの対抗的トレーニングのサンプル複雑性を低減すること。
  • より安定的で効率的な発散最小化フレームワークを学習することで、リtrieval性能を向上させること。
  • ハッシュコード最適化におけるヒューリスティック制約を排除し、暗黙的な分布マッチングによって実現すること。
  • 大規模応用に適したスケーラブルで効率的かつ高性能な教師なし画像ハッシングモデルを構築すること。

提案手法

  • 本手法は、元の分布とターゲット分布が最も異なる方向に沿って、1次元バーレルシュタイン距離の平均値としてバーレルシュタイン距離を推定する新規な発散推定技術を導入する。
  • 2値ハッシュコードの離散的性質を活用して、標準的なバーレルシュタイン距離よりも汎用性が高く、最適化が容易な成分別バーレルシュタイン距離を構築する。
  • 学習済みハッシュコード分布をターゲットの離散的事前分布に一致させるために対抗的トレーニングを用い、明示的な制約なしに局所性を保つハッシュ関数を暗黙的に学習する。
  • ランダム射影を用いることで、距離推定を効率的に計算し、トレーニング中の高速収束と安定した勾配を実現する。
  • ミニバッチを用いた確率的勾配降下法でトレーニングされる、GAN風の識別器を備えた変分オートエンコーダーとしてフレームワークを実装する。
  • 離散的バーレルシュタイン距離の固有の性質に依存することで、明示的な正則化項のハイパーパramータチューニングの必要性を回避する。

実験結果

リサーチクエスチョン

  • RQ1より汎用性の高いバーレルシュタイン距離の変種は、対抗的オートエンコーダーに基づく画像ハッシングのサンプル効率と一般化性能を向上させ得るか?
  • RQ21次元バーレルシュタイン距離の成分別平均化は、ハッシングにおける対抗的トレーニングの収束性と安定性を向上させるか?
  • RQ3提案手法は、既存のバーレルシュタインベースの対抗的ハッシングモデルと比較して、著しく短いトレーニング時間で優れたリtrieval性能を達成できるか?
  • RQ4標準的なバーレルシュタイン距離とスライスド・バーレルシュタイン距離と比較して、提案手法の距離推定は勾配の安定性と最適化ダイナミクスにおいて優れているか?
  • RQ5ハッシュコードの離散的構造は、潜在空間におけるより効率的かつ効果的な発散推定をどの程度可能にするか?

主な発見

  • DCW-AE は、複数の実世界データセットにおいて、現在の最先端手法と比較して最大10%高いリtrieval性能を達成する。
  • 提案手法は、既存の対抗的ハッシング手法と比較して、サンプル複雑性が1桁以上優れており、少ないトレーニングサンプルでより良い一般化性能を実現する。
  • 1エポックあたりのトレーニング時間が著しく短縮されている—CIFAR10、FlickR25K、PLACE365 データセットにおいて、DCW-AE は OT-AE や WGAN-AE よりもはるかに高速にトレーニングされる。
  • 特にランダム射影の数が少ない場合でも、DCW-AE の距離推定値と勾配ノルムは SWD と比較してより安定している。
  • t-SNE 視覚化では、DCW-AE がより構造的で分離可能な埋め込み空間を学習しており、4と9のような類似した数字を効果的に区別していることが示された。
  • 非対抗的ベースライン(ITQ、DistillHash)および他の対抗的モデル(OT-AE、SWD-AE)と比較して、特にリtrieval精度と耐性の観点で優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。