Skip to main content
QUICK REVIEW

[論文レビュー] Discrete Multi-modal Hashing with Canonical Views for Robust Mobile Landmark Search

Lei Zhu, Zi Huang|arXiv (Cornell University)|Jul 13, 2017
Advanced Image and Video Retrieval Techniques参考文献 52被引用数 11
ひとこと要約

本稿では、高帯域幅のクエリ送信とモバイルランドマーク検索(MLS)における極端な視覚的変動という課題に取り組むため、一貫性のあるビューに基づく離散的マルチモodalハッシュング(CV-DMH)という新しいハッシュングフレームワークを提案する。CV-DMHは、サブモジュラー最適化を用いて判別性の高い一貫性のあるビューを同定し、これらのビュー上でマルチモーダルスパースコーディングを用いて視覚的コンテンツを符号化し、増分ラグランジュ乗数法を用いた直接最適化により離散的バイナリコードを学習する。CV-DMHは、離散性、ビット相関なし、バランス制約を同時に強制することで、複数のデータセットにおいてmAPの面で既存手法を上回り、最先端の性能を達成する。

ABSTRACT

Mobile landmark search (MLS) recently receives increasing attention for its great practical values. However, it still remains unsolved due to two important challenges. One is high bandwidth consumption of query transmission, and the other is the huge visual variations of query images sent from mobile devices. In this paper, we propose a novel hashing scheme, named as canonical view based discrete multi-modal hashing (CV-DMH), to handle these problems via a novel three-stage learning procedure. First, a submodular function is designed to measure visual representativeness and redundancy of a view set. With it, canonical views, which capture key visual appearances of landmark with limited redundancy, are efficiently discovered with an iterative mining strategy. Second, multi-modal sparse coding is applied to transform visual features from multiple modalities into an intermediate representation. It can robustly and adaptively characterize visual contents of varied landmark images with certain canonical views. Finally, compact binary codes are learned on intermediate representation within a tailored discrete binary embedding model which preserves visual relations of images measured with canonical views and removes the involved noises. In this part, we develop a new augmented Lagrangian multiplier (ALM) based optimization method to directly solve the discrete binary codes. We can not only explicitly deal with the discrete constraint, but also consider the bit-uncorrelated constraint and balance constraint together. Experiments on real world landmark datasets demonstrate the superior performance of CV-DMH over several state-of-the-art methods.

研究の動機と目的

  • 高帯域幅のクエリ送信とモバイルランドマーク検索(MLS)における極端な視覚的変動という課題に対処すること。
  • 冗長性を最小限に抑えつつ、主要な視覚的特徴を捉える一貫性のあるビューを用いてランドマークの外観をモデル化することで、ハッシュのロバスト性と判別力を向上させること。
  • 緩和を経由するのではなく、直接的にバイナリコードを最適化する離散的マルチモーダルハッシュング手法を開発し、緩和と丸めによる量子化誤差を回避すること。
  • 短いバイナリコードを学習することで、効率的な低ビット数のクエリ送信と高速な検索を実現すること。
  • 視覚的・文脈的特徴を含むマルチモーダル特徴を、一貫性のあるビューに基づく統一された表現に統合し、一般化性能を向上させること。

提案手法

  • 視覚的代表性と冗長性を同時に測定するサブモジュラー関数を設計し、理論的保証のもとで最適な一貫性のあるビューを反復的に抽出する。
  • マルチモーダルスパースコーディングにより、複数のモダリティからの特徴を、一貫性のあるビューに対してよりロバストに視覚的コンテンツを符号化する中間表現に変換する。
  • 中間表現をコン pact なバイナリコードにマップするための離散的バイナリ埋め込みモデルを提案し、増分ラグランジュ乗数(ALM)法を用いて離散制約を直接解く。
  • ALMに基づく最適化により、離散的符号化、ビット相関なし、バランス制約の3つを同時に強制し、2段階の緩和手法で一般的に生じる量子化誤差を回避する。
  • 埋め込み空間における意味的関係を保持するために、視覚的類似性グラフに基づいてラプラシアン行列を構築する。
  • 本フレームワークは3段階で構成される:一貫性のあるビューの同定、中間表現の学習、離散的バイナリコードの最適化。

実験結果

リサーチクエスチョン

  • RQ1ランドマークの代表的で冗長性のない視点(一貫性のあるビュー)は、モバイルランドマーク検索におけるロバストなマルチモーダルハッシュングの安定した基盤として機能するか?
  • RQ2一貫性のあるビューを基準に、ランドマークの多様な視覚的外観を効果的に符号化するマルチモーダル特徴の表現方法は何か?
  • RQ3緩和を経由しない直接的な離散的バイナリコード最適化は、従来の「緩和と丸め」アプローチと比較して、検索性能を顕著に向上させるか?
  • RQ4離散性、ビット相関なし、バランス制約を同時に強制することで、学習されたハッシュコードの判別力はどの程度向上するか?
  • RQ5最適化目的関数におけるハイパーパrameter(α, β, γ)の変動に対して、本手法はどの程度安定性を示すか?

主な発見

  • CV-DMHは、パリ5K、パリ14K、パリ500kという3つの実世界のランドマークデータセットにおいて、複数の最先端ハッシュング手法を上回る優れた平均平均精度(mAP)を達成した。
  • アブレーションスタディの結果、離散制約を緩和する手法と比較して、ALMによる直接的離散最適化が顕著に性能向上をもたらすことが確認され、量子化誤差を回避する有効性が裏付けられた。
  • ハイパーパrameterの変動に対しても、最適化目的関数におけるα, β, γの広い範囲で安定したmAP性能を示し、ロバスト性が確認された。
  • 収束解析の結果、目的関数値が約7〜8イテレーション後に減少し、安定化することが示され、アルゴリズムの収束特性が裏付けられた。
  • すべての設定において、CV-DMH-III や CV-DMH-IV と比較して、CV-DMHの性能が一貫して高く維持されており、3つの制約を同時に強制することが不可欠であることが証明された。
  • 実験的結果から、128ビットなどの短いバイナリコード長でも、本手法は高い性能を維持することが示され、低帯域幅のモバイル送信に適していることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。