Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Tracking Representations via Dual-Branch Fully Transformer Networks

Fei Xie, Chunyu Wang|arXiv (Cornell University)|2021. 12. 05.
Video Surveillance and Tracking Methods인용 수 4
한 줄 요약

이 논문은 CNN을 특징 추출에 의존하지 않고, 자기주의 메커니즘을 통해 직접 시각 추적 특징을 학습하는 시아모이드 유사 이중 브랜치 완전 트랜스포머 네트워크인 DualTFR를 제안한다. 각 브랜치 내부에 국소 및 전역 주의 블록을 사용하고, 최종 레이어에서 단일 교차 주의 블록을 적용함으로써 GOT-10k 및 VOT2020 벤치마크에서 최신 기술 수준의 성능을 달성하면서도 단일 GPU에서 약 40 fps의 실시간 추론을 유지한다.

ABSTRACT

We present a Siamese-like Dual-branch network based on solely Transformers for tracking. Given a template and a search image, we divide them into non-overlapping patches and extract a feature vector for each patch based on its matching results with others within an attention window. For each token, we estimate whether it contains the target object and the corresponding size. The advantage of the approach is that the features are learned from matching, and ultimately, for matching. So the features are aligned with the object tracking task. The method achieves better or comparable results as the best-performing methods which first use CNN to extract features and then use Transformer to fuse them. It outperforms the state-of-the-art methods on the GOT-10k and VOT2020 benchmarks. In addition, the method achieves real-time inference speed (about $40$ fps) on one GPU. The code and models will be released.

연구 동기 및 목표

  • 매칭을 통해 직접 특징을 학습함으로써 비전 트랜스포머가 CNN 기반 특징 추출기보다 시각 추적에서 승승을 거두는지 조사하기 위해.
  • CNN에 의존하지 않으면서도 높은 정확도와 실시간 속도를 유지하는 경량이고 효율적인 이중 브랜치 트랜스포머 아키텍처를 설계하기 위해.
  • 특히 하이브리드 'CNN+Transformer' 파이프라인과의 비교에서 순수 트랜스포머 기반 특징 학습의 효과성을 검증하기 위해.
  • 엔드 투 엔드 트랜스포머 기반 추적을 위한 블록 설계, 사전 훈련, 주의 메커니즘에 대한 경험적 통찰을 제공하기 위해.

제안 방법

  • 템플릿 및 검색 이미지를 겹치지 않는 패치로 나누고, 각 브랜치 내에서 자기주의를 통해 특징을 추출하는 이중 브랜치 트랜스포머 아키텍처를 적용한다.
  • 초기 특징 추출을 위해 고해상도 특징 맵에 국소 주의 블록(LAB)을 사용하고, 장거리 의존성 모델링을 위해 저해상도 맵에 전역 주의 블록(GAB)을 적용한다.
  • 최종 레이어에 단일 교차 주의 블록(CAB)을 도입하여 템플릿 브랜치와 검색 브랜치 간의 특징을 융합함으로써 분류 능력을 향상시킨다.
  • 각 토큰 위에 분류 헤드와 회귀 헤드를 적용하여 객체 존재 여부와 바운딩 박스 크기를 직접 예측한다.
  • 저해상도 특징에만 전역 주의를 적용하여 추론 속도를 최적화함으로써 FLOPs를 감소시키면서도 정확도를 유지한다.
  • 사전 훈련 없이 또는 ImageNet 사전 훈련을 통해 모델을 훈련시어 사전 훈련이 성능과 수렴에 미치는 영향을 평가한다.

실험 결과

연구 질문

  • RQ1완전히 트랜스포머 기반 아키텍처가 시각 추적에서 우세한 'CNN+Transformer' 방법을 능가할 수 있는가?
  • RQ2CNN의 감독 없이도 이미지 패치에 직접 자기주의를 적용할 경우, 추적에서 특징 추출에 효과적인가?
  • RQ3정확도와 추론 속도를 균형 있게 유지하기 위해 국소, 전역, 교차 주의 블록의 최적 구성은 무엇인가?
  • RQ4완전히 트랜스포머 기반 추적 모델에서 ImageNet 사전 훈련은 훈련을 시작으로부터의 성능에 얼마나 중요한가?
  • RQ5기존 상관 기반 융합 방식과 비교해 주의 기반 특징 융합(CAB)이 추적 성능 향상에 뚜렷한 기여를 하는가?

주요 결과

  • DualTFR는 VOT2020 벤치마크에서 새로운 최고 기록인 EAO 점수 0.528을 기록하여 STARK 및 TransT와 같은 기존 방법들을 능가한다.
  • GOT-10k 벤치마크에서 ImageNet으로 사전 훈련한 경우 AO 점수는 73.5%를 기록했으며, 교차 주의 대신 깊이 분리 상관을 사용한 경우 51.2%에 그치는 것으로 나타나, 사전 훈련이 성능 향상에 기여함을 입증한다.
  • 단일 NVIDIA 2080Ti GPU에서 약 40 fps로 실행되어 실시간 추론 능력을 입증한다.
  • 제거 실험 결과, 전역 주의 블록(GAB)을 사용할 경우 AO 점수가 42.1%에서 46.1%로 향상되었고, 교차 주의 블록을 추가하면 성능이 42.1%에서 48.5%로 상승함을 확인했다.
  • ImageNet 사전 훈련은 필수적이다: 훈련을 시작으로부터 수행할 경우 성능이 73.5%에서 48.5%로 급격히 하락하여, 순수 트랜스포머 파이프라인에 있어 사전 훈련이 중요한 인덕티브 바이어스를 제공한다는 것을 시사한다.
  • 44.1M 파라미터와 18.9G FLOPs를 가진 모델이 VOT2020에서 STARK(42.4M 파라미터, 18.5G FLOPs)보다 더 높은 정확도를 기록함으로써, 효율성-정확도 균형이 향상되었음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.