Skip to main content
QUICK REVIEW

[論文レビュー] Deep Stochastic Attraction and Repulsion Embedding for Image Based Localization.

Liu Liu, Hongdong Li|arXiv (Cornell University)|Aug 27, 2018
Advanced Image and Video Retrieval Techniques参考文献 30被引用数 6
ひとこと要約

本論文では、競争的学習を通じて特徴を学習することにより、同一場所の画像間の類似度を最大化し、異なる場所の画像間の類似度を最小化することで、画像ベースの局所化の精度を向上させる、新しい損失関数であるStochastic Attraction and Repulsion Embedding(SARE)を提案する。SAREは、標準ベンチマーク上での局所化精度を、三重項順序付け損失を用いた最先端手法を大きく上回る程度で向上させる。

ABSTRACT

This paper tackles the problem of large-scale image-based localization where the geographical location at which a query image was taken is estimated by retrieving geo-tagged reference images depicting the same place from a large database. For this problem, an important and yet under-researched issue is how to learn discriminative image representations that are best tailored to the task of geo-localization. Aiming to find a novel image representation having higher location-discriminating power, this paper presents the following contributions: 1) we represent a place (location) as a set of exemplar images depicting the same landmarks, instead of some pre-defined geographic locations by partitioning the world; 2) we advocate the use of competitive learning among places, directly via feature embeddings, aiming to maximize similarities among intra-class images while minimizing similarities among inter-class images. This represents a significant departure from the state-of-the-art IBL methods using triplet ranking loss, which only enforces intra-place visual similarities are bigger than inter-place ones; 3) we propose a new Stochastic Attraction and Repulsion Embedding (SARE) loss function to facilitate the competitive learning. Our SARE loss is easy to implement and pluggable to any Convolutional Neural Network. Experiments show that the method improves localization performance on standard benchmarks by a large margin.

研究の動機と目的

  • 大規模な画像ベースの局所化に特化した判別性の高い画像表現の欠如に対処すること。
  • 場所を事前に定義された地理的領域ではなく、例示画像の集合としてモデル化することで、局所化性能を向上させること。
  • クラス内類似度を高め、クラス間類似度を低下させる競争的学習を通じて、特徴埋め込みを直接かつエンドツーエンドで最適化すること。
  • 任意のCNNアーキテクチャと互換性があり、実装が簡単なプラグアンドプレイ型の損失関数を開発すること。

提案手法

  • 世界を固定された地理的ボックスに分割するのではなく、同じランドマークを示す位置付き画像の集合として各場所を表現する。
  • 同じ場所内での類似度(クラス内)を増加させ、異なる場所間の類似度(クラス間)を低下させる、特徴埋め込みを直接最適化する競争的学習メカニズムを導入する。
  • SARE損失関数を提案し、埋め込み空間における吸引と反発を強制するために、アンカーやポジティブ、ネガティブ画像の三重組を確率的にサンプリングする。
  • 任意のCNNバックボーンと互換性があり、微分可能であるようにSARE損失を設計し、既存のディープラーニングパイプラインへのシームレスな統合を可能にする。
  • SARE損失を用いて、地理的局所化タスクに特化した高 discriminative 特徴埋め込みを学習する。
  • 訓練中に確率的サンプリングを用いることで、画像の外観や視点の変化に対して一般化性とロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1固定された地理的領域ではなく、例示画像の集合として場所をモデル化することで、局所化性能が向上するか?
  • RQ2特徴空間におけるクラス内およびクラス間類似度を直接最適化する競争的学習は、三重項順序付け損失を上回るか?
  • RQ3SAREのようなシンプルでプラグアンドプレイ型の損失関数は、アーキテクチャの変更なしに局所化精度を顕著に向上させられるか?
  • RQ4SAREは、視覚的多様性が非常に高い大規模な実世界の画像データベースにおいて、どの程度効果的か?

主な発見

  • SARE損失は、三重項順序付け損失を用いた最先端手法と比較して、標準ベンチマーク上での局所化性能を顕著に向上させる。
  • 本手法は、同一場所の画像間の吸引と、異なる場所の画像間の反発を明示的にモデル化することで、より高い精度を達成する。
  • SAREは多様な実世界のデータセットで有効であり、視覚的変化や大規模データに対してロバストであることが示された。
  • 提案手法は、任意のCNNベースのモデルに容易に統合可能であり、画像ベースの局所化において実用的で強力なツールである。
  • 実験により、SAREによる競争的学習は、従来の順序付けベースのアプローチよりもより判別性の高い特徴埋め込みを生成することが確認された。
  • 本手法は、標準的な画像ベースの局所化ベンチマークで最先端の性能を達成しており、先行手法を大きく上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。