Skip to main content
QUICK REVIEW

[論文レビュー] TransVPR: Transformer-based place recognition with multi-level attention aggregation

Ruotong Wang, Yanqing Shen|arXiv (Cornell University)|Jan 6, 2022
Robotics and Sensor-Based Localization被引用数 5
ひとこと要約

TransVPRは、視覚的場所認識のためのビジョンTransformerベースのモデルを提案する。このモデルは、タスク関連の特徴を動的に統合するために多段階の自己注意マップを活用し、それらを組み合わせて耐障害性の高いグローバル表現を生成するとともに、フィルタリングされた出力トークンをキーパッチ記述子として用いて空間的再ランク付けを行う。エンド・トゥ・エンドの学習が可能であり、画像レベルの監視のみを用いるが、計算コストは低く抑えられ、最先端の性能を達成している。ベースラインで最も優れた手法(DELG)に対して、Recall@1で5.8%の絶対的向上を達成している。

ABSTRACT

Visual place recognition is a challenging task for applications such as autonomous driving navigation and mobile robot localization. Distracting elements presenting in complex scenes often lead to deviations in the perception of visual place. To address this problem, it is crucial to integrate information from only task-relevant regions into image representations. In this paper, we introduce a novel holistic place recognition model, TransVPR, based on vision Transformers. It benefits from the desirable property of the self-attention operation in Transformers which can naturally aggregate task-relevant features. Attentions from multiple levels of the Transformer, which focus on different regions of interest, are further combined to generate a global image representation. In addition, the output tokens from Transformer layers filtered by the fused attention mask are considered as key-patch descriptors, which are used to perform spatial matching to re-rank the candidates retrieved by the global image features. The whole model allows end-to-end training with a single objective and image-level supervision. TransVPR achieves state-of-the-art performance on several real-world benchmarks while maintaining low computational time and storage requirements.

研究の動機と目的

  • 複雑なシーンにおいて、不要な要素が性能を低下させるという課題に対処すること。
  • トランスフォーマーにおける自己注意機構を用いて、タスク関連の領域を効果的に選択的に統合することで、特徴の耐障害性を向上させること。
  • 統一的かつエンド・トゥ・エンドで学習可能なアーキテクチャ内で、グローバル画像表現とパッチレベルの記述子を同時に学習すること。
  • 多段階の注意マップ統合と空間的再ランク付けを活用することで、実世界のベンチマークにおいて高い精度と効率を達成すること。
  • キーポイントのアノテーションや弱い監視を排除し、画像レベルの監視に依存するのみで実現すること。

提案手法

  • モデルは、入力画像から階層的特徴を抽出するためにビジョンTransformerエンコーダを用いる。
  • 異なるTransformer層からの多段階の自己注意マップを統合し、意味的に重要な領域に注目するグローバル画像表現を生成する。
  • 各Transformer層の出力トークンを、統合された注意マスクを用いてフィルタリングし、空間的マッチング用のキーパッチ記述子を生成する。
  • 統合された注意マップを用いて、パッチトークンの重み付き和としてグローバル特徴を計算することで、関連領域に焦点を当てる。
  • パッチレベルの記述子をRANSACベースの空間的マッチング手順で用い、グローバル特徴によって取得された候補を再ランク付けする。
  • すべてのモジュールが、画像レベルの監視のみを用いて、単一の対照的損失目的関数に基づきエンド・トゥ・エンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1ビジョンTransformerにおける多段階の注意マップ統合は、複雑で干渉要因の多い視覚的条件下でも、視覚的場所認識の耐障害性を向上させることができるか?
  • RQ2異なるTransformer層からの注意マップを統合することは、グローバル画像表現やパッチ記述子の品質にどのように影響を与えるか?
  • RQ3複数のTransformer層からのフィルタリング済み出力トークンは、明示的なキーポイント監視がなくても、空間的再ランク付けのための効果的なキーパッチ記述子として機能するか?
  • RQ4提案手法のエンド・トゥ・エンドで画像レベルの監視のみを用いるアプローチは、弱い監視や別段階の学習に依存する従来手法を上回る性能を達成できるか?
  • RQ5個々の注意マップと統合された多段階の注意マップを用いる場合の認識精度と一般化性能に、それぞれどのような影響があるか?

主な発見

  • TransVPRは、ベンチマークデータセット上で、最も優れたベースライン手法(DELG)に対して、Recall@1で5.8%の絶対的向上を達成した。
  • Patch-NetVLAD、NetVLAD、DELGを含む最先端の手法を、複数の実世界ベンチマークで上回った。
  • 低レベル、中レベル、高レベルの特徴からの注意マップを統合することで、個々のまたは単一レベルの注意マップを用いる場合よりも優れたグローバル表現学習が達成された。
  • 最後の層を除く任意のTransformer層から抽出したパッチ記述子は、類似した性能を示し、最初の層からの生パッチ記述子よりも顕著に優れていた。
  • 最終のTransformer層からの記述子を用いる際には、わずかに性能が低下した。これは、過剰な文脈的統合が局所性を損なう可能性を示唆している。
  • キーパッチ記述子を用いた再ランク付けは、顕著に性能を向上させた。特に、重度の知覚的アリバイ(perceptual aliasing)に苦しむNordlandデータセットにおいて顕著な向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。