Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Attraction-Repulsion Embedding for Large Scale Image Localization

Liu Liu, Hongdong Li|arXiv (Cornell University)|Aug 27, 2018
Advanced Image and Video Retrieval Techniques参考文献 36被引用数 4
ひとこと要約

本論文は、L2距離上の確率的分布として、同一場所内類似性と異なる場所間非類似性をモデル化することで、大規模な画像ベースローカライゼーションのための画像表現学習を向上させる、新しい損失関数であるStochastic Attraction and Repulsion Embedding (SARE)を提案する。SAREは予測された一致可能性分布と真値の一致可能性分布の間のKLダイバージェンスを最小化し、最先端の性能を達成しており、2018年Google Landmark Retrieval Challengeで3位を獲得した。

ABSTRACT

This paper tackles the problem of large-scale image-based localization (IBL) where the spatial location of a query image is determined by finding out the most similar reference images in a large database. For solving this problem, a critical task is to learn discriminative image representation that captures informative information relevant for localization. We propose a novel representation learning method having higher location-discriminating power. It provides the following contributions: 1) we represent a place (location) as a set of exemplar images depicting the same landmarks and aim to maximize similarities among intra-place images while minimizing similarities among inter-place images; 2) we model a similarity measure as a probability distribution on L_2-metric distances between intra-place and inter-place image representations; 3) we propose a new Stochastic Attraction and Repulsion Embedding (SARE) loss function minimizing the KL divergence between the learned and the actual probability distributions; 4) we give theoretical comparisons between SARE, triplet ranking and contrastive losses. It provides insights into why SARE is better by analyzing gradients. Our SARE loss is easy to implement and pluggable to any CNN. Experiments show that our proposed method improves the localization performance on standard benchmarks by a large margin. Demonstrating the broad applicability of our method, we obtained the third place out of 209 teams in the 2018 Google Landmark Retrieval Challenge. Our code and model are available at https://github.com/Liumouliu/deepIBL.

研究の動機と目的

  • 同一場所内での吸引と異なる場所間での反発を明示的にモデル化することで、大規模な画像ベースローカライゼーション(IBL)のための識別的画像表現学習を向上させること。
  • 従来の方法が三重項順序付けや対照的損失に依存しているが、原理的な確率的定式化がないという限界を克服すること。
  • 任意のCNNアーキテクチャと互換性があり、アーキテクチャの変更なしにCNNベースの特徴埋め込みを向上させる微分可能で、プラグアンドプレイ可能な損失関数を開発すること。
  • Google Landmark Retrieval Challengeを含む広範なベンチマークと実世界の課題を通じて、SAREの優位性を検証すること。
  • 微調整なしに、標準的な画像検索データセットにおいてSAREで学習されたモデルの一般化性能を示すこと。

提案手法

  • 本手法は、画像類似性を二値分類タスクとしてモデル化する:同一場所ペア(吸引)は1、異なる場所ペア(反発)は0とする。
  • クエリ正例ペアおよびクエリ負例ペアの特徴埋め込み間のL2距離上に確率的分布を定義する。
  • SARE損失は、予測された確率的分布と真値の一致可能性分布との間のKullback-Leibler(KL)ダイバージェンスとして定式化される。
  • この損失関数は、任意のCNNアーキテクチャと互換性があり、既存のIBLパイプラインに容易に統合可能である。
  • 1つのクエリに対して複数の負例をサポートし、複数の異なる場所間での競争を可能にする。
  • 本手法はVGG16にNetVLADプーリングとL2正規化された特徴を用い、その後L2距離の計算と確率的マッチングを実行する。

実験結果

リサーチクエスチョン

  • RQ1従来のメトリック学習損失を超えて、大規模な画像ローカライゼーションのための画像埋め込みの識別力をどのように向上させられるか?
  • RQ2同一場所内吸引と異なる場所間反発を確率的定式化することで、標準的な対照的損失や三重項損失よりも優れたローカライゼーション性能が達成できるか?
  • RQ3微調整なしに、SARE損失は標準的な画像検索ベンチマークにうまく一般化できるか?
  • RQ4SAREは、対照的損失や三重項損失といった既存のメトリック学習目的関数に理論的にどのような利点を有するか?
  • RQ5SAREは、Google Landmark Retrieval Challengeのような実世界の課題で最先端の性能を達成できるか?

主な発見

  • SAREは2018年Google Landmark Retrieval Challengeで209チーム中3位を獲得し、実世界での強力な性能を示した。
  • Sf-0ベンチマークでは、フル画像でmAP 80.71%、クロップド画像でmAP 81.07%を達成し、NetVLADやCRNを上回った。
  • Oxford5kおよびParis6kデータセットでは、それぞれmAP 71.66%および82.03%を達成し、NetVLADやCRNといったベースライン手法を上回った。
  • 本手法は、画像検索タスクにおいて優れた一般化性能を示し、3つのベンチマークすべてで、市販のNetVLADやCRNよりもmAPが一貫して高かった。
  • 定性的な分析から、SAREは画像の特徴的な建築的詳細に注目しているのに対し、NetVLADは局所的特徴に注目していることが確認された。
  • 理論的分析により、SAREの勾配ダイナミクスは、対照的損失や三重項損失よりもより好ましいことが示され、その実証的優位性が説明された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。