Skip to main content
QUICK REVIEW

[論文レビュー] Data-Efficient Large Scale Place Recognition With Graded Similarity Supervision

Maria Leyva-Vallina, Nicola Strisciuglio|arXiv (Cornell University)|Mar 11, 2021
Advanced Image and Video Retrieval Techniques参考文献 59被引用数 12
ひとこと要約

本稿では、視覚的場所認識におけるシアンセイCNNの学習に、二値の類似度ではなく連続的で段階的な類似度ラベルを用いる一般化コントラスト損失(GCL)関数を提案する。GPS、ポーズ、3次元再構築を用いてMSLS、TB-Places、7Scenesを再ラベル付けすることで、GCLで学習されたモデルが二値対応のモデルやNetVLAD や Patch-NetVLAD といった最先端手法を上回り、MSLSでトップ5リCALLを76.2%に達成するとともに、複雑なハードネガティブマイニングの必要性を排除した。

ABSTRACT

Visual place recognition (VPR) is a fundamental task of computer vision for visual localization. Existing methods are trained using image pairs that either depict the same place or not. Such a binary indication does not consider continuous relations of similarity between images of the same place taken from different positions, determined by the continuous nature of camera pose. The binary similarity induces a noisy supervision signal into the training of VPR methods, which stall in local minima and require expensive hard mining algorithms to guarantee convergence. Motivated by the fact that two images of the same place only partially share visual cues due to camera pose differences, we deploy an automatic re-annotation strategy to re-label VPR datasets. We compute graded similarity labels for image pairs based on available localization metadata. Furthermore, we propose a new Generalized Contrastive Loss (GCL) that uses graded similarity labels for training contrastive networks. We demonstrate that the use of the new labels and GCL allow to dispense from hard-pair mining, and to train image descriptors that perform better in VPR by nearest neighbor search, obtaining superior or comparable results than methods that require expensive hard-pair mining and re-ranking techniques.

研究の動機と目的

  • 画像間の部分的または連続的な類似度を捉えられない二値類似度ラベル付けの限界を是正すること。
  • 連続的類似度スコアを活用することで、埋め込み空間の学習を向上させる一般化コントラスト損失関数の開発。
  • 幾何学的および3次元再構築データを用いて、既存データセット(MSLS、TB-Places、7Scenes)を自動的に段階的類似度ラベルで再ラベル付けすること。
  • GCLで学習されたシアンセイCNNが、複雑なマイニング戦略を用いずに多様なベンチマークで一般化性能を発揮すること。
  • 連続的監視とGCLが、二値コントラスト学習に比べて高い性能とより効率的な訓練を実現することの実証。

提案手法

  • 類似度を二値ではなく、画像類似度の度合いに比例して埋め込み距離をペナルティ化する一般化コントラスト損失(GCL)関数を提案。
  • 3つの自動ラベル付け戦略を開発:弱い2次元視野(FoV)オーバーラップ(GPSとコンパスを使用)、強い2次元視野(FoV)オーバーラップ(6DOFポーズを使用)、3次元視野(FoV)オーバーラップ(3次元再構築を使用)。
  • GCL関数を用いて、完全畳み込みバックボーンとGeMまたは平均プーリングを用いたグローバル埋め込みのためのシアンセイネットワークを学習。
  • 一般化と性能向上のため、PCAホワイトニングと次元削減を適用。
  • ハードネガティブマイニングを回避するシンプルなバッチバランス戦略(正例と負例ペアの数を等しくする)を用いてモデルを訓練。
  • 評価のため、MSLS、Pittsburgh30k、Tokyo24/7、RobotCar Seasons v2、Extended CMU Seasonsにモデルを展開。

実験結果

リサーチクエスチョン

  • RQ1段階的類似度監視は、二値監視に比べて、視覚的場所認識におけるシアンセイネットワークの性能向上に寄与するか?
  • RQ2提案された一般化コントラスト損失(GCL)関数は、ハードネガティブマイニングを用いずに多様なデータセットに一般化できるか?
  • RQ3大規模データセットにおける画像ペア間の段階的類似度を推定する自動的で幾何学ベースの手法の有効性はいかほどか?
  • RQ4PCAホワイトニングは、学習済み画像埋め込みの性能と一般化能力をどの程度向上させるか?
  • RQ5GCLベースのモデルは、NetVLAD や Patch-NetVLAD といった最先端手法に比べ、トップ5リCALLと訓練効率の両面で優れているか?

主な発見

  • ResNeXt-GeM-GCLモデルは、MSLSバリデーションセットでトップ5リCALLが76.2%に達し、NetVLAD(58.8%)、NetVLAD-SARE(44.3%)、AP-GeM(44.5%)、Patch-NetVLAD(57.6%)を上回った。
  • GCLベースのモデルは、MSLS、TB-Places、7Scenesにおいて、二値コントラスト損失対応モデルに比べて最大18%高いトップ5リCALLを達成した。
  • MSLSではGCLで学習する際、1エポックで十分だったのに対し、NetVLAD-16とNetVLAD-64はそれぞれ22エポックと7エポックを要したため、訓練時間は顕著に短縮された。
  • PCAホワイトニングは、Tokyo24/7で最大28.2%、MSLSバリデーションで最大12.8%の性能向上をもたらしたが、記述子次元を128または256に削減しても有効であった。
  • ResNeXt-GeM-GCLモデルは256次元でも優れた性能を維持した。VGG16-GeM-GCLは256次元でトップリCALLがピークに達した。
  • Pittsburgh30k、Tokyo24/7、RobotCar Seasons v2、Extended CMU Seasonsにおいても、視点、照明、季節の変化に対して強い一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。