Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Siamese Transformer Network for Single Object Tracking on Point Clouds

Le Hui, Lingpeng Wang|arXiv (Cornell University)|2022. 07. 25.
Video Surveillance and Tracking Methods인용 수 4
한 줄 요약

이 논문은 KITTI, nuScenes, Waymo 벤치마크에서 상태최저 성능을 달성하기 위해 자가어텐션을 사용한 인코더-디코더 아키텍처를 활용해 형태적 맥락과 교차어텐션을 통해 강력한 템플릿-검색 상관관계를 학습하는 3D 시아모닉 트랜스포머 네트워크인 STNet을 제안한다. 이는 자동차의 외관 변화에 강건한 성능을 발휘하기 위해 거칠기에서 세밀한 상관관계를 반복적으로 개선함으로써 특징 융합을 정교화한다.

ABSTRACT

Siamese network based trackers formulate 3D single object tracking as cross-correlation learning between point features of a template and a search area. Due to the large appearance variation between the template and search area during tracking, how to learn the robust cross correlation between them for identifying the potential target in the search area is still a challenging problem. In this paper, we explicitly use Transformer to form a 3D Siamese Transformer network for learning robust cross correlation between the template and the search area of point clouds. Specifically, we develop a Siamese point Transformer network to learn shape context information of the target. Its encoder uses self-attention to capture non-local information of point clouds to characterize the shape information of the object, and the decoder utilizes cross-attention to upsample discriminative point features. After that, we develop an iterative coarse-to-fine correlation network to learn the robust cross correlation between the template and the search area. It formulates the cross-feature augmentation to associate the template with the potential target in the search area via cross attention. To further enhance the potential target, it employs the ego-feature augmentation that applies self-attention to the local k-NN graph of the feature space to aggregate target features. Experiments on the KITTI, nuScenes, and Waymo datasets show that our method achieves state-of-the-art performance on the 3D single object tracking task.

연구 동기 및 목표

  • 희소하고 비정규적인 포인트 클라우드에서 템플릿 영역과 검색 영역 간의 큰 외관 변화 문제를 해결하기 위해.
  • 시아모닉 트랜스포머 인코더-디코더 구조를 통해 장거리 형태 맥락을 캡처함으로써 특징 표현을 향상시키기 위해.
  • 반복적인 거친-세밀한 특징 융합을 통해 템플릿과 검색 영역 간의 상관관계 학습을 향상시키기 위해.
  • 특징 공간 내 국소 k-NN 그래프에 자가어텐션을 적용하여 국소적 특징 융합을 강화함으로써 분류 능력 향상 특징 학습을 강화하기 위해.
  • 종합적인 주의 기반 프레임워크를 사용해 표준 3D 추적 벤치마크에서 최고 성능을 달성하기 위해.

제안 방법

  • 인코더에서 자가어텐션을 사용해 포인트 클라우드에서 비국소적 형태 맥락을 캡처하는 시아모닉 포인트 트랜스포머 네트워크를 사용한다.
  • 디코더는 학습 가능한 어텐션 가중치를 사용한 적응형 특징 보간을 통해 하향샘플링된 포인트에서 원본 해상도로 특징을 업샘플링한다.
  • 반복적인 거친-세밀한 상관관계 네트워크는 교차어텐션을 사용해 템플릿과 검색 영역의 특징을 융합하여 거친 위치 추정을 가능하게 한다.
  • 에고-특징 증강은 특징 공간 내 국소 k-NN 그래프에 자가어텐션을 적용하여 의미적으로 유사한 특징을 융합하고 목표물 표현을 향상시킨다.
  • 주의 맵이 목표물 위치 추정을 안내하는 방식으로, 특징 학습과 상관관계 학습을 종합적으로 최적화하며, 엔드 투 엔드 학습을 수행한다.
  • k-NN 크기(K) 및 반복 횟수와 같은 하이퍼파라미터는 최적의 성능 및 메모리 효율성 확보를 위해 조정된다.

실험 결과

연구 질문

  • RQ1자가어텐션 메커니즘이 희소한 3D 포인트 클라우드에서 장거리 형태 맥락을 효과적으로 모델링하여 추적 성능을 향상시킬 수 있는가?
  • RQ2교차어텐션과 에고어텐션을 활용한 반복적 거친-세밀한 상관관계 학습이 외관 변화에 대한 강인성을 향상시키는가?
  • RQ33D 추적에서 국소적 특징 융합(k-NN 기반)과 전역 어텐션 사이의 최적의 균형은 무엇인가?
  • RQ4기존의 2D 및 3D 시아모닉 백엔드와 비교해 본다면, 제안된 시아모닉 트랜스포머의 정확도 및 추론 효율성은 어떠한가?
  • RQ5주의 기반 형태 맥락 학습이 실제 3D 데이터셋에서 추적 성능 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 STNet는 KITTI, nuScenes, Waymo 데이터셋에서 최고 성능을 기록했으며, 성공률 72.1%와 정밀도 84.0%를 달성했다.
  • 제거 실험 결과, 비국소 임베딩과 적응형 특징 보간을 조합하면 성공률가 66.1%에서 72.1%로 향상됨을 확인했다.
  • 교차특징 증강(CF aug.)과 에고특징 증강(EF aug.)을 모두 적용한 경우가 가장 우수한 성능을 보였으며, 단일 모듈 기반 베이스라인을 능가했다.
  • 에고특징 증강에 최적의 k-NN 크기는 K=48로, 국소 구조를 잘 캡처하면서 배경 노이즈를 효과적으로 억제하는 데 최적의 균형을 이룬다.
  • 거친-세밀한 상관관계 네트워크에서 두 번의 반복이 성능과 GPU 메모리 사용량 사이의 최적의 트레이드오���을 제공한다.
  • 시각화 결과, 모든 구성 요소를 포함한 STNet는 목표물에 효과적으로 집중하는 반면, 부분적인 모델은 차량과 배경을 구분하지 못함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.