[논문 리뷰] SparseTT: Visual Tracking with Sparse Transformers
SparseTT는 타겟 중심 주의 메커니즘을 갖춘 희소 트랜스포머를 사용하여 검색 영역 내 관련 특징에 중점을 두어 추적 정확도를 향상시키는 시아모이스 시각 추적 프레임워크를 제안한다. 이는 LaSOT, GOT-10k, TrackingNet, UAV123에서 40 FPS로 최신 기술 성능을 달성하며, TransT보다 75% 빠른 훈련 속도를 기록한다.
Transformers have been successfully applied to the visual tracking task and significantly promote tracking performance. The self-attention mechanism designed to model long-range dependencies is the key to the success of Transformers. However, self-attention lacks focusing on the most relevant information in the search regions, making it easy to be distracted by background. In this paper, we relieve this issue with a sparse attention mechanism by focusing the most relevant information in the search regions, which enables a much accurate tracking. Furthermore, we introduce a double-head predictor to boost the accuracy of foreground-background classification and regression of target bounding boxes, which further improve the tracking performance. Extensive experiments show that, without bells and whistles, our method significantly outperforms the state-of-the-art approaches on LaSOT, GOT-10k, TrackingNet, and UAV123, while running at 40 FPS. Notably, the training time of our method is reduced by 75% compared to that of TransT. The source code and models are available at https://github.com/fzh0917/SparseTT.
연구 동기 및 목표
- 전체적인 맥락 모델링으로 인해 자기주의 주의가 배경에 과도하게 집중되고 타겟에 대한 집중이 부족해지는 바닐라 트랜스포머의 한계를 해결한다.
- 타겟 변형, 부분적 가림, 척도 변화와 같은 도전적인 조건에서도 추적 정확도를 향상시킨다.
- TransT와 같은 기존 트랜스포머 기반 추적기와 비교해 성능을 유지하거나 향상시키면서도 훈련 시간을 단축시킨다.
- 전경-배경 분류 및 바운딩 박스 회귀 정확도를 향상시키기 위해 더블헤드 예측기를 도입한다.
- 검색 영역 내 가장 관련성이 높은 특징에만 집중하는 희소 주의 메커니즘을 개발하여 분별력 있는 특징 표현을 향상시킨다.
제안 방법
- 검색 영역 내 가장 관련성이 높은 공간 위치에만 주의 계산을 제한하는 희소 자기주의 주의 메커니즘을 제안하여 배경 특징에 의한 혼란을 줄인다.
- 검색 영역 내 타겟 객체에 해당하는 핵심 특징을 동적으로 식별하고 강조하는 타겟 포커스 네트워크를 통합한다.
- 분류(전경 대 배경)와 회귀(바운딩 박스 좌표)를 위한 별도의 브랜치를 갖춘 더블헤드 예측기를 설계하여 예측 정확도를 향상시킨다.
- 템플릿과 검색 영역의 백본 특징이 희소 트랜스포머 인코더를 통해 처리되어 맥락 인식 표현을 생성하는 시아모이스 추적 프레임워크를 구축한다.
- 유연한 쿼리 메커니즘을 사용해 검색 영역 내 관련 특징에 주의를 기울여 외관 변화가 심한 상황에서도 정밀한 국소화를 가능하게 한다.
- 검출 및 국소화 성능를 최적화하기 위해 분류 손실과 회귀 손실의 조합을 사용해 모델을 엔드 투 엔드로 훈련시킨다.
실험 결과
연구 질문
- RQ1전체 배경 맥락 대신 가장 관련성이 높은 타겟 특징에 집중하는 희소 주의 메커니즘이 시각 추적 정확도 향상에 기여할 수 있는가?
- RQ2제안된 더블헤드 예측기는 분류 및 회귀 정확도 측면에서 단일헤드 예측기와 비교해 어떻게 성능을 높이는가?
- RQ3기존 트랜스포머와 비교해 희소 주의 메커니즘이 추적 성능을 유지하거나 향상시키면서 훈련 시간을 얼마나 줄일 수 있는가?
- RQ4이러한 도전 과제가 다양한 벤치마크에서 발생하는 경우(예: 가림, 변형, 척도 변화)로 인해 제안된 방법의 일반화 능력은 어느 정도인가?
- RQ5희소 트랜스포머 프레임워크는 주요 추적 벤치마크에서 최신 기술 성능을 뛰어넘으면서도 실시간 추론 속도(40 FPS)를 달성할 수 있는가?
주요 결과
- SparseTT는 LaSOT, GOT-10k, TrackingNet, UAV123에서 최신 기술 성능을 달성하며, 정확도와 내성 면에서 TransT 및 기타 최신 기술 추적기들을 능가한다.
- GOT-10k에서 SparseTT는 AO 점수 0.693, SR@0.5는 0.791, SR@0.75는 0.638을 기록하여 TransT(АО: 0.671, SR@0.5: 0.768)를 상당한 격차로 앞서며 성능을 뛰어넘었다.
- UAV123에서 SparseTT는 성공률 0.704와 정밀도 0.704를 기록하여 TransT(0.691 및 0.694)와 기타 선도적 방법들을 능가했다.
- TrackingNet에서 SparseTT는 최고의 성공률(81.7%)과 정규화된 정밀도(86.6%)를 기록하여 대규모 데이터에서 뛰어난 일반화 능력을 입증했다.
- SparseTT의 훈련 시간은 TransT의 25%로 줄어들었으며, 성능을 유지하거나 향상시키면서도 훈련 시간이 75% 감소한 것으로 나타났다.
- SparseTT는 추론 시 40 FPS로 작동하여 정확도를 희생시키지 않고도 실시간 배포 능력을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.