[논문 리뷰] Robust Object Modeling for Visual Tracking
이 논문은 이중 스트림 어텐션을 사용하여 내재된 특징과 하이브리드 템플릿 특징을 함께 모델링하고, 변화를 반영하는 적응형 변형 토큰을 도입함으로써 성능을 향상시키는 새로운 시각 추적 프레임워크인 ROMTrack을 제안한다. 이 방법은 여섯 개의 벤치마크에서 최신 기술 수준을 달성하며, LaSOT ${}_{\text{ext}}$에서 AUC 기준 최대 2.5% 향상된 성능을 보였다.
Object modeling has become a core part of recent tracking frameworks. Current popular tackers use Transformer attention to extract the template feature separately or interactively with the search region. However, separate template learning lacks communication between the template and search regions, which brings difficulty in extracting discriminative target-oriented features. On the other hand, interactive template learning produces hybrid template features, which may introduce potential distractors to the template via the cluttered search regions. To enjoy the merits of both methods, we propose a robust object modeling framework for visual tracking (ROMTrack), which simultaneously models the inherent template and the hybrid template features. As a result, harmful distractors can be suppressed by combining the inherent features of target objects with search regions' guidance. Target-related features can also be extracted using the hybrid template, thus resulting in a more robust object modeling framework. To further enhance robustness, we present novel variation tokens to depict the ever-changing appearance of target objects. Variation tokens are adaptable to object deformation and appearance variations, which can boost overall performance with negligible computation. Experiments show that our ROMTrack sets a new state-of-the-art on multiple benchmarks.
연구 동기 및 목표
- 시각 추적에서 별도의 템플릿 학습과 상호작용 템플릿 학습의 한계를 해결하기 위해 그 강점을 융합함으로써 성능을 향상시키기.
- 하이브리드 템플릿 학습에서 간섭 물체의 오염 위험을 줄이면서도 분류 능력을 유지하기.
- 새로운 계산 효율적인 토큰 설계를 통해 물체의 변형과 외관 변화에 대한 강건성을 향상시키기.
- 템플릿 갱신에 의존하지 않고도 여러 표준 시각 추적 벤치마크에서 최신 기술 수준의 성능을 달성하기.
제안 방법
- 순수한 목표물 특징를 유지하기 위한 내재 템플릿 스트림과 검색 영역과 상호 기능 강화를 위한 하이브리드 템플릿 스트림을 갖춘 이중 템플릿 아키텍처를 제안한다.
- 하이브리드 템플릿 특징에서 유도된 변형 토큰을 도입하여 추적 과정 중 동적인 외관 변화를 모델링한다.
- 교차 어텐션 계산에 변형 토큰을 통합하여 계산 비용을 증가시키지 않으면서도 외관 맥락을 향한 어텐션을 안내한다.
- 두 단계의 훈련 전략을 사용한다: 먼저 대규모 데이터셋에서 사전 훈련하고, 이후 연속 샘플링 전략을 사용하여 시간적 외관 동역학을 학습한다.
- 내재 템플릿 스트림에서는 자기 어텐션을, 하이브리드 템플릿 스트림에서는 교차 어텐션을 사용하여 이중 방향의 기능 상호작용을 구현한다.
- 추론 중 물체의 변형과 외관 이동에 적응할 수 있는 경량이지만 효과적인 변형 토큰 메커니즘을 설계한다.
실험 결과
연구 질문
- RQ1내재된 특징과 하이브리드 템플릿 특징를 함께 사용할 경우, 각각을 별도로 사용할 때보다 추적 강건성이 향상되는가?
- RQ2제안된 변형 토큰 메커니즘이 계산 비용을 증가시키지 않고도 외관 변화를 효과적으로 모델링할 수 있는가?
- RQ3훈련 중 연속 샘플링 전략이 시간적 외관 변화를 학습하는 데 효과적인가?
- RQ4제안된 프레임워크가 표준 벤치마크에서 기존 최신 기술 수준의 추적기들보다 얼마나 뛰어난가?
- RQ5변형 토큰 설계를 온라인 템플릿 갱신과 조합하면 성능 향상이 추가로 이루어지는가?
주요 결과
- ROMTrack는 여섯 개의 벤치마크에서 새로운 최신 기술 수준을 달성하였으며, LaSOT에서 69.3%의 AUC, LaSOT ${}_{\text{ext}}$에서 48.9%의 AUC를 기록하여 기존 방법보다 최대 2.5% 높은 AUC 성능을 보였다.
- 제거 실험 결과 변형 토큰의 중요성을 확인할 수 있었다: ROMTrack (w/o vt)는 LaSOT에서 0.5% 낮고, LaSOT ${}_{\text{ext}}$에서는 0.7% 낮은 성능을 보였다.
- 훈련 중 연속 샘플링 전략은 무작위 샘플링 대비 성능 향상을 보였으며, 시간적 외관 동역학을 학습하는 데 효과적임을 입증했다.
- LaSOT에서 HTM-400(400 에포크 훈련)보다 0.5% 높은 AUC, LaSOT ${}_{\text{ext}}$에서는 2.6% 높은 AUC를 기록하여, 더 긴 훈련만으로는 아키텍처의 우수성을 보여주었다.
- 온라인 템플릿 갱신과 조합했을 때 변형 토큰 설계가 성능 향상에 기여했으며, HTM-vt-online은 LaSOT에서 0.5% 높고, LaSOT ${}_{\text{ext}}$에서는 0.4% 높은 AUC를 기록했다.
- 다양한 추적 과제, 특히 가림, 척도 변화 등에서 일관된 성능 향상을 보이며 간섭 물체와 변형에 대해 강건함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.