Skip to main content
QUICK REVIEW

[논문 리뷰] CiteTracker: Correlating Image and Text for Visual Tracking

Xin Li, Yuqing Huang|arXiv (Cornell University)|2023. 08. 22.
Video Surveillance and Tracking Methods인용 수 5
한 줄 요약

CiteTracker는 이미지 패치에서 기술적 문장 생성하고, 이 문장을 주변 이미지와 주의 기반 모듈을 통해 상관관계화함으로써 목표물 모델링을 향상시키는 혁신적인 시각 추적 프레임워크를 제안한다. 언어 신호를 활용해 더 추상적이고 안정적인 표현을 얻음으로써, 다섯 가지 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 외관 변화와 초기화 불량에 대해 뛰어난 견고성을 보여준다.

ABSTRACT

Existing visual tracking methods typically take an image patch as the reference of the target to perform tracking. However, a single image patch cannot provide a complete and precise concept of the target object as images are limited in their ability to abstract and can be ambiguous, which makes it difficult to track targets with drastic variations. In this paper, we propose the CiteTracker to enhance target modeling and inference in visual tracking by connecting images and text. Specifically, we develop a text generation module to convert the target image patch into a descriptive text containing its class and attribute information, providing a comprehensive reference point for the target. In addition, a dynamic description module is designed to adapt to target variations for more effective target representation. We then associate the target description and the search image using an attention-based correlation module to generate the correlated features for target state reference. Extensive experiments on five diverse datasets are conducted to evaluate the proposed algorithm and the favorable performance against the state-of-the-art methods demonstrates the effectiveness of the proposed tracking method.

연구 동기 및 목표

  • 단일 이미지 패치 기반 참조의 한계를 해결하기 위해, 외관 변화와 모호성에 취약한 기존 방법의 문제점을 해결한다.
  • 이미지만으로는 제공할 수 없는 더 추상적이고 정밀한 개념을 제공하는 언어 신호를 활용해 목표물 표현을 향상시킨다.
  • 시간이 지남에 따라 목표물의 외관 변화에 적응하는 동적 텍스트 특징 생성 기법을 개발한다.
  • 주의 기반 상관관계 모듈을 통해 이미지 및 텍스트 특징를 융합하여 추적 정확도와 견고성을 향상시킨다.

제안 방법

  • 사전 정의된 개방형 어휘(클래스 및 속성 레이블)를 활용한 프롬프트 학습을 통해 CLIP을 백본으로 사용하여 목표물 이미지 패치에서 기술적 문장을 생성하는 텍스트 생성 모듈을 개발한다.
  • 목표물의 외관 변화에 따라 적응하는 동적 기술 설명 모듈을 통해 자동으로 업데이트되는 텍스트 특징를 생성함으로써 자세, 조명, 부분 가림 등의 변화에 대한 견고성을 향상시킨다.
  • 생성된 텍스트 기반 기술 설명과 검색 이미지의 특징을 주의 기반 상관관계 모듈을 통해 융합하여 목표물 상태 예측을 위한 상관 특징를 생성한다.
  • 이 프레임워크는 이미지-텍스트 상관관계를 추적 파이프라인에 통합하여 기존의 단순 이미지 기반 기준을 언어 기반 강화된 표현으로 대체한다.
  • 이중 특징를 정렬하기 위해 대비 손실을 사용하여 엔드 투 엔드로 모델을 훈련시키며, 정확한 국소화를 최적화한다.
  • 제안된 방법은 GOT-10K, LaSOT, TrackingNet, OTB100, TNL2K를 포함한 다섯 가지 다양한 데이터셋에서 평가되었으며, 구성 요소별 분석을 통해 각 요소의 기여도를 검증하였다.

실험 결과

연구 질문

  • RQ1이미지 패치에서 생성된 텍스트 기술 설명이 외관 변화 상황에서 목표물 표현을 향상시키는가?
  • RQ2동적 텍스트 특징 적응 기법이 시간이 지남에 따라 추적의 견고성을 어떻게 향상시키는가?
  • RQ3도전적인 추적 환경에서 순수한 시각적 상관관계 대비 이미지-텍스트 상관관계가 얼마나 뛰어나게 성능을 높이는가?
  • RQ4불량한 초기화 또는 저품질 목표물 샘플 상황에서 제안된 방법은 어떻게 성능을 내는가?
  • RQ5시각적 신호가 모호하거나 오도될 경우 언어 신호가 추적을 안정화시키는 데 기여하는가?

주요 결과

  • CiteTracker는 GOT-10K, LaSOT, TrackingNet, OTB100, TNL2K를 포함한 모든 다섯 가지 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.
  • 속성 기술 설명의 포함으로 OTB2015에서는 정밀도가 1.6% 향상되었고, TNL2K에서는 0.5% 향상되어 그 기여도가 검증되었다.
  • 동적 기술 설명 생성 모듈은 OTB2015에서 AUC 성능을 0.3% 향상시키며, GOT-10K에서는 0.2%, TNL2K에서는 0.3% 향상시켜 그 효과를 입증했다.
  • 초기화에 대한 견고성이 뛰어나 OTB에서 TRE-worst 성능이 OSTrack 대비 3.6% 향상되었다.
  • 시각화 결과는 극적인 외관 변화가 있더라도 생성된 텍스트 기술 설명이 일관성을 유지함을 확인하여 안정적인 목표물 식별을 뒷받침한다.
  • Bolt, Ironman, YellowPeople, James 등의 도전적인 시퀀스에서 OSTrack가 실패하는 상황에서도 CiteTracker는 정확한 추적을 유지하며, 특히 운동 블러, 조명 변화, 악성 배경 간섭 상황에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.