Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Lightweight Hierarchical Vision Transformers for Efficient Visual Tracking

Ben Kang, Xin Chen|arXiv (Cornell University)|2023. 08. 14.
Visual Attention and Saliency Detection인용 수 6
한 줄 요약

이 논문은 효율적인 시각 추적을 위한 경량화된 계층적 비전 트랜스포머인 HiT를 제안한다. 브릿지 모듈을 통해 깊은 의미 특징과 浅층 고해상도 특징을 융합하고, 이중 이미지 위치 인코딩을 통해 공간 인식 능력을 향상시킨다. HiT는 LaSOT에서 64.6% AUC를 기록하며, 임베디드 장치인 Jetson AGX 에지에서 61 fps로 실행되어 이전의 효율적인 추적기들보다 성능과 속도 면에서 뛰어나다.

ABSTRACT

Transformer-based visual trackers have demonstrated significant progress owing to their superior modeling capabilities. However, existing trackers are hampered by low speed, limiting their applicability on devices with limited computational power. To alleviate this problem, we propose HiT, a new family of efficient tracking models that can run at high speed on different devices while retaining high performance. The central idea of HiT is the Bridge Module, which bridges the gap between modern lightweight transformers and the tracking framework. The Bridge Module incorporates the high-level information of deep features into the shallow large-resolution features. In this way, it produces better features for the tracking head. We also propose a novel dual-image position encoding technique that simultaneously encodes the position information of both the search region and template images. The HiT model achieves promising speed with competitive performance. For instance, it runs at 61 frames per second (fps) on the Nvidia Jetson AGX edge device. Furthermore, HiT attains 64.6% AUC on the LaSOT benchmark, surpassing all previous efficient trackers.

연구 동기 및 목표

  • 자원 제한이 있는 엣지 장치에서 트랜스포머 기반 시각 추적기의 성능-속도 트레이드오프 문제를 해결한다.
  • 추적에 사용되는 경량 계층적 백본에서 큰 스트라이드 다운샘플링으로 인한 정보 손실을 완화한다.
  • 템플릿 및 검색 영역 이미지의 위치 정보를 함께 인코딩하여 추적의 공간 모델링 능력을 향상시킨다.
  • 경량 계층적 트랜스포머의 효율적 배포를 가능하게 하는 일반화된 프레임워크를 개발한다.

제안 방법

  • 깊은 레이어에서 유도된 고수준 의미 특징과 얕은 고해상도 특징을 융합하여 다운샘플링 과정에서 잃어버린 공간 세부 정보를 보존하는 브릿지 모듈을 도입한다.
  • 템플릿과 검색 영역을 대각선 배열로 고유하고 겹치지 않는 위치로 할당하는 이중 이미지 위치 인코딩 기법을 제안하여 공동 위치 인코딩을 가능하게 한다.
  • 사전 훈련된 경량 계층적 비전 트랜스포머 백본(LeViT 또는 PVT)을 사용하는 일체형 추적 프레임워크를 채택하여 엔드 투 엔드 특징 추출 및 융합을 수행한다.
  • 이중 이미지 환경에서 상대적 위치 인코딩을 사용하여 이미지 간 공간 관계를 모델링하면서 중복되거나 겹치는 위치 정보를 도입하지 않는다.
  • 다양한 경량 계층적 백본(예: LeViT-384, PVT-Small)을 쉽게 통합할 수 있도록 모듈러한 HiT 프레임워크를 설계한다.
  • 표준 추적 손실 함수와 표준 추적 헤드를 사용하여 모델을 훈련시키되, 경량 구성 요소를 유지하여 추론 효율성을 확보한다.

실험 결과

연구 질문

  • RQ1큰 스트라이드 다운샘플링으로 인한 정보 손실가 존재하는 상황에서도 경량 계층적 비전 트랜스포머가 시각 추적에 효과적으로 적용될 수 있는가?
  • RQ2템플릿과 검색 영역을 함께 인코딩하는 방식이 별도로 인코딩하는 것보다 추적 성능을 얼마나 향상시키는가?
  • RQ3제안된 브릿지 모듈이 엣지 장치에서 고속 추론을 유지하면서도 공간 세부 정보를 효과적으로 복원할 수 있는가?
  • RQ4HiT 프레임워크가 LeViT 및 PVT와 같은 다양한 경량 계층적 백본에 대해 일반화 가능한가?
  • RQ5HiT가 엣지 플랫폼에서 효율적인 시각 추적기들 간의 최첨단 성능-속도 트레이드오프를 달성할 수 있는가?

주요 결과

  • HiT는 LaSOT 벤치마크에서 64.6% AUC를 기록하여 이전의 모든 효율적 추적기들을 능가하며 고성능 모델들과도 맞먹거나 초월한다.
  • HiT는 Nvidia Jetson AGX Xavier 엣지 장치에서 61 fps로 실행되어 TransT(13 fps)와 FEAR(38 fps)보다 뚜렷이 빠른 속도를 기록한다.
  • HiT-Base는 동일한 엣지 플랫폼에서 FEAR보다 LaSOT에서 AUC 11.1% 높게 기록하면서도 1.6배 빠른 속도를 확보한다.
  • PVT-Small 백본을 사용한 HiT는 LaSOT에서 63.9% AUC, TrackingNet에서 78.4% AUC를 기록하여 다양한 백본 간 강력한 일반화 능력을 입증한다.
  • 대각선 배열로 구성된 이중 이미지 위치 인코딩이 절대적, 별도의 상대적, 수직 및 수평 인코딩 방식보다 우수한 성능을 보이며 최고의 AUC 점수를 기록한다.
  • HiT는 AGX 플랫폼에서 STARK-ST50보다 4.7배 더 빠르면서도 유사한 성능을 유지하여 실시간 배포에서의 우수성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.