[논문 리뷰] ProContEXT: Exploring Progressive Context Transformer for Tracking
ProContEXT는 다중 해상도의 정적 및 동적 템플릿을 사용하여 공간적 및 시간적 맥락을 점진적으로 인코딩하는 새로운 트랜스포머 기반 시각적 객체 추적기를 제안한다. 맥락 인식 자기주의 기반 및 적응형 토큰 프루닝을 통해 성능을 향상시켰으며, GOT-10k와 TrackingNet에서 SOTA 성능을 달성하여 54.3 FPS 추론 속도에서 86.8% AO 및 96.8% SR@0.5를 기록한다.
Existing Visual Object Tracking (VOT) only takes the target area in the first frame as a template. This causes tracking to inevitably fail in fast-changing and crowded scenes, as it cannot account for changes in object appearance between frames. To this end, we revamped the tracking framework with Progressive Context Encoding Transformer Tracker (ProContEXT), which coherently exploits spatial and temporal contexts to predict object motion trajectories. Specifically, ProContEXT leverages a context-aware self-attention module to encode the spatial and temporal context, refining and updating the multi-scale static and dynamic templates to progressively perform accurately tracking. It explores the complementary between spatial and temporal context, raising a new pathway to multi-context modeling for transformer-based trackers. In addition, ProContEXT revised the token pruning technique to reduce computational complexity. Extensive experiments on popular benchmark datasets such as GOT-10k and TrackingNet demonstrate that the proposed ProContEXT achieves state-of-the-art performance.
연구 동기 및 목표
- 초기 프레임에서 단일 정적 템플릿에 의존하는 기존 시각적 객체 추적기의 한계를 해결하기 위해, 특히 빠르게 변화하고 혼잡한 장면에서의 성능을 향상시키기 위해.
- 외관 변화와 가림 현상으로 인한 추적 성능 저하를 공간적 및 시간적 맥락을 통합하여 극복하기 위해.
- 다중 해상도의 정적 및 동적 템플릿을 활용하여 변화하는 객체 외관을 모델링하는 실시간이고 효율적인 추적 프레임워크를 개발하기 위해.
- 트랜스포머 기반 백본에서 재정의된 토큰 프루닝 전략을 통해 정확도를 유지하면서 계산 효율성을 향상시키기 위해.
- 기존의 전통적 맥락 추적과 맥락 없음 기반 방법 사이를 연결하는 새로운 트렌스포머 기반 추적에서 맥락 인식 및 점진적 특징 인코딩의 새로운 패러다임을 수립하기 위해.
제안 방법
- 초기 프레임에서의 정적 템플릿과 이전 추적 결과에서 업데이트된 동적 템플릿을 활용하는 이중 템플릿 메커니즘을 도입하여 외관 변화를 모델링한다.
- 다중 해상도의 템플릿과 검색 영역을 통해 공간적 및 시간적 맥락을 동시에 인코딩하는 맥락 인식 자기주의 모듈을 활용한다.
- ViT 스타일의 입력을 위해 리스케일링 모듈을 통해 모든 템플릿과 검색 영역을 재형상하고, 패치 임bed딩 및 위치 인코딩을 수행한다.
- 주의도 지도의 흐릿함에 따라 동적으로 조정되는 유지 비율 $\rho$를 사용한 토큰 프루닝 기법을 적용하여 FLOPs를 감소시키면서도 핵심 특징을 유지한다.
- 프레임 간 점진적 정밀화 루프를 통해 바운딩 박스 예측 및 동적 템플릿 업데이트를 위한 추적 헤드를 사용한다.
- 대규모 벤치마크에서 일반화 능력을 향상시키기 위해 MAE 사전학습을 도입하여 특징 표현 품질을 향상시킨다.
실험 결과
연구 질문
- RQ1빠르게 변화하고 혼잡한 영상 시퀀스에서 공간적 및 시간적 맥락의 점진적 인코딩이 추적의 강건성 향상에 기여하는가?
- RQ2다중 해상도의 정적 및 동적 템플릿 통합이 단일 템플릿 기반 베이스라인 대비 추적 정확도에 어떤 영향을 미치는가?
- RQ3맥락 인식 자기주의가 트랜스포머 기반 추적기의 특징 표현을 얼마나 향상시키는가?
- RQ4실시간 추적에서 토큰 프루닝을 적용할 경우 계산 효율성과 추적 정확도 사이의 최적의 트레이드오프는 무엇인가?
- RQ5점진적 맥락 인코딩을 갖춘 통합 프레임워크가 추가 브랜치나 복잡한 모듈 없이도 기존 SOTA 방법을 초월할 수 있는가?
주요 결과
- MAE 사전학습을 통한 ProContEXT는 GOT-10k에서 86.8% AO 및 96.8% SR@0.5를 기록했으며, 이는 이전 SOTA 메서드인 OStrack보다 AO, SR@0.5, SR@0.75 각각 0.9%, 1.5%, 2.1% 향상된 성능이다.
- 동적 템플릿의 포함으로 정적 템플릿 전용 대비 AO가 1.2% 향상되고 SR@0.5가 1.4% 향상되어 시간적 맥락의 가치를 입증한다.
- 여러 정적 템플릿(예: 스케일 [2.0, 4.0]) 사용은 AO에서 +1.7%, SR@0.5에서 +2.2% 향상시켜 공간적 맥락 모델링의 효과를 확인한다.
- 절단 실험 결과, 토큰 프루닝에서 유지 비율 $\rho = 0.7$을 적용하면 GFLOPs가 16.5% 감소(38.0 GFLOPs로)하면서 AO는 1.1% 향상되고 SR@0.5는 1.3% 향상된다.
- 표준 하드웨어에서 ProContEXT는 54.3 FPS의 추론 속도를 기록하여 확장된 맥락 모델링에도 불구하고 실시간 성능을 입증한다.
- TrackingNet에서도 SOTA 메서드들보다 뛰어난 성능을 기록하여 모델의 강건성과 확장성의 우수함을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.