Skip to main content
QUICK REVIEW

[논문 리뷰] TransVPR: Transformer-based place recognition with multi-level attention aggregation

Ruotong Wang, Yanqing Shen|arXiv (Cornell University)|2022. 01. 06.
Robotics and Sensor-Based Localization인용 수 5
한 줄 요약

TransVPR는 시각적 장소 인식을 위한 비전 트랜스포머 기반 모델을 제안하며, 작업에 관련된 특징을 동적으로 집계하기 위해 다중 수준의 자기주의 맵을 활용한다. 이는 강력한 전역 표현을 생성하고, 필터링된 출력 토큰을 키패치 기반 기술자로 사용하여 공간 재순서를 수행한다. 이는 최적의 베이스라인 대비 Recall@1에서 5.8%의 절대적 향상을 달성하면서도 낮은 계산 비용을 유지하고, 이미지 수준의 지도 학습을 통해 엔드 투 엔드 학습이 가능하다.

ABSTRACT

Visual place recognition is a challenging task for applications such as autonomous driving navigation and mobile robot localization. Distracting elements presenting in complex scenes often lead to deviations in the perception of visual place. To address this problem, it is crucial to integrate information from only task-relevant regions into image representations. In this paper, we introduce a novel holistic place recognition model, TransVPR, based on vision Transformers. It benefits from the desirable property of the self-attention operation in Transformers which can naturally aggregate task-relevant features. Attentions from multiple levels of the Transformer, which focus on different regions of interest, are further combined to generate a global image representation. In addition, the output tokens from Transformer layers filtered by the fused attention mask are considered as key-patch descriptors, which are used to perform spatial matching to re-rank the candidates retrieved by the global image features. The whole model allows end-to-end training with a single objective and image-level supervision. TransVPR achieves state-of-the-art performance on several real-world benchmarks while maintaining low computational time and storage requirements.

연구 동기 및 목표

  • 복잡한 환경에서 방해가 되는 요소들로 인해 성능 저하가 발생하는 시각적 장소 인식 과제를 해결하기 위해.
  • 트랜스포머의 자기주의 메커니즘을 활용해 작업에 관련된 영역을 선택적으로 집계함으로써 특징의 강건성을 향상시키기 위해.
  • 통합된 엔드 투 엔드 학습 가능한 아키텍처 내에서 전역 이미지 표현과 패치 수준의 기술자를 함께 학습하기 위해.
  • 다중 수준의 주의 집계와 공간 재순서를 통해 실세계 벤치마크에서 높은 정확도와 효율성을 달성하기 위해.
  • 약한 지도나 키포인트 애너테이션을 제거하고 오직 이미지 수준의 지도 학습에 의존함으로써 기존 방법에 비해 개선된 성능을 달성하기 위해.

제안 방법

  • 모델은 입력 이미지에서 계층적 특징을 추출하기 위해 비전 트랜스포머 인코더를 사용한다.
  • 다양한 트랜스포머 레이어에서 유도된 다중 수준의 자기주의 맵을 융합하여 의미 있는 영역에 중점을 두는 전역 이미지 표현을 생성한다.
  • 각 트랜스포머 레이어의 출력 토큰은 융합된 주의 맵을 사용하여 필터링되어 공간 매칭을 위한 키패치 기술자를 생성한다.
  • 융합된 주의 맵을 사용하여 패치 토큰의 가중치 합으로 전역 특징를 계산함으로써 관련 영역에 대한 집중도를 향상시킨다.
  • 패치 수준의 기술자는 RANSAC 기반의 공간 매칭 단계에서 사용되어 전역 특징에 의해 검색된 후보들을 재순서한다.
  • 모든 구성 요소는 오직 이미지 수준의 지도 학습을 사용하는 단일 대비 손실 목적 함수를 통해 엔드 투 엔드로 학습된다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머에서 다중 수준의 주의 집계가 복잡하고 방해가 되는 시각 조건에서 시각적 장소 인식의 강건성 향상에 기여하는가?
  • RQ2다양한 트랜스포머 레이어에서 유도된 주의 맵을 융합하는 것이 전역 이미지 표현과 패치 기술자의 품질에 어떤 영향을 미치는가?
  • RQ3여러 트랜스포머 레이어에서 필터링된 출력 토큰이 키포인트 지도 없이도 효과적인 키패치 기술자로 기능할 수 있는가?
  • RQ4제안된 엔드 투 엔드, 이미지 수준의 지도 학습 방법이 약한 지도나 별도의 학습 단계에 의존하는 기존 방법보다 우수한 성능을 내는가?
  • RQ5개별 주의 맵을 사용하는 것과 다중 수준의 주의 융합을 사용하는 것의 인식 정확도와 일반화 능력에 미치는 영향은 무엇인가?

주요 결과

  • TransVPR는 벤치마크 데이터셋에서 최적의 베이스라인인 DELG에 비해 Recall@1에서 5.8%의 절대적 향상을 달성한다.
  • 모델은 Patch-NetVLAD, NetVLAD, DELG를 포함한 최첨단 방법들을 여러 실세계 벤치마크에서 모두 압도적으로 능가한다.
  • 저수준, 중간수준, 고수준 특징의 주의 맵을 융합하면 개별 또는 단일 수준의 주의 맵을 사용하는 것보다 우수한 전역 표현 학습을 가능하게 한다.
  • 모든 트랜스포머 레이어(마지막 레이어를 제외하고)에서 추출된 패치 기술자는 유사하게 성능을 보이며, 첫 번째 레이어의 원본 패치 기술자보다 유의미하게 뛰어나다.
  • 최종 트랜스포머 레이어에서 추출된 기술자를 사용할 경우 성능이 약간 저하되며, 이는 과도한 문맥 집합이 국소성의 감소를 유도할 수 있음을 시사한다.
  • 키패치 기술자를 사용한 재순서는 특히 심각한 인지적 이중성 문제를 야기하는 Nordland 데이터셋에서 성능 향상에 크게 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.