[논문 리뷰] Transforming Model Prediction for Tracking
이 논문은 전통적인 최적화 기반 모델 예측기 대신 트랜스포머 기반 모델 예측기를 도입하여 더 표현력 있는 타깃 모델을 학습하는 새로운 추적 프레임워크 ToMP을 제안한다. 분류 성능을 높이기 위해 타깃 모델과 바운딩 박스 회귀기의 가중치를 동시에 예측함으로써 ToMP는 라솔트(LaSOT)에서 68.5%의 AUC를 기록하며 여러 벤치마크에서 기존 방법을 능가하는 최신 기술 수준(SoTA) 성능을 달성한다.
Optimization based tracking methods have been widely successful by integrating a target model prediction module, providing effective global reasoning by minimizing an objective function. While this inductive bias integrates valuable domain knowledge, it limits the expressivity of the tracking network. In this work, we therefore propose a tracker architecture employing a Transformer-based model prediction module. Transformers capture global relations with little inductive bias, allowing it to learn the prediction of more powerful target models. We further extend the model predictor to estimate a second set of weights that are applied for accurate bounding box regression. The resulting tracker relies on training and on test frame information in order to predict all weights transductively. We train the proposed tracker end-to-end and validate its performance by conducting comprehensive experiments on multiple tracking datasets. Our tracker sets a new state of the art on three benchmarks, achieving an AUC of 68.5% on the challenging LaSOT dataset.
연구 동기 및 목표
- 분류 상관 필터(DCF) 추적기에서 최적화 기반 모델 예측기의 표현력이 제한되어 있는 문제를 해결하기 위해.
- DCF 최적화의 인덕티브 바이어스를 트랜스포머를 통한 전역적 추론 메커니즘으로 대체하여 추적 성능을 향상시키기 위해.
- 테스트 시점 특징에서 타깃 모델 가중치와 바운딩 박스 회귀 가중치를 모두 예측함으로써 엔드 투 엔드 학습을 가능하게 하기 위해.
- 트랜스포머 입력에 타깃 위치와 크기 정보를 위한 새로운 인코딩을 도입하여 국소화 정확도를 향상시키기 위해.
- 라솔트(LaSOT), OTB-100, UAV123를 포함한 여러 표준 추적 벤치마크에서 최신 기술 수준(SoTA) 성능을 달성하기 위해.
제안 방법
- 표준 DCF 모델 최적화기 대신, 지원 프레임과 쿼리 프레임의 특징 시퀀스로부터 타깃 모델 가중치를 생성하는 트랜스포머 기반 모델 예측기를 도입한다.
- 타깃 위치와 타깃 크기 정보를 위한 두 가지 새로운 위치 인코딩을 도입하여 트랜스포머가 관련된 공간 정보에 집중하도록 유도한다.
- 모델 예측기의 출력을 확장하여 별도의 바운딩 박스 회귀기 네트워크를 위한 두 번째 가중치 세트를 출력함으로써 국소화의 전도적 정밀도 향상을 가능하게 한다.
- 두 단계 추론 파이프라인을 활용: 먼저 국소화를 위한 타깃 모델 가중치를 예측하고, 이후 두 번째 가중치 세트를 사용해 정밀한 바운딩 박스 회귀를 수행한다.
- 모델 예측 및 회귀 단계를 펼쳐내는 미분 가능한 최적화 과정을 사용하여 전체 추적기를 엔드 투 엔드로 학습한다.
- 특징 추출을 위해 ResNet-50 및 ResNet-101 백본을 활용하며, 트랜스포머가 지원 및 쿼리 특징을 모두 처리하여 가중치 예측을 수행한다.
실험 결과
연구 질문
- RQ1트랜스포머 기반 모델 예측기가 시각적 추적에서 기존 최적화 기반 모델 예측기보다 뛰어난 성능을 낼 수 있는가?
- RQ2타깃 모델 가중치와 회귀 가중치를 동시에 예측하는 방식이 추적 정확도와 강건성을 향상시키는가?
- RQ3타깃 위치와 크기 정보를 위한 특수 설계된 인코딩이 트랜스포머 기반 추적기의 성능에 어떤 영향을 미치는가?
- RQ4전도적이고 테스트 시점에 가중치를 예측하는 메커니즘이 고정 또는 최적화된 모델보다 더 나은 일반화 성능을 낼 수 있는가?
- RQ5제안된 방법이 주요 시각적 추적 벤치마크에서 새로운 최신 기술 수준(SoTA)을 달성하는가?
주요 결과
- ToMP는 라솔트(LaSOT) 벤치마크에서 68.5%의 AUC를 기록하며 새로운 최신 기술 수준(SoTA)을 달성했으며, 이는 이전 방법들보다 뚜렷이 뛰어난 성능이다.
- ToMP-101은 VOT2020ST 챌린지에서 가장 높은 강건성과 경쟁 가능한 정확도를 확보하여 EAO 점수 0.309를 기록하며 바운딩 박스 전용 추적기 중 1위를 차지했다.
- OTB-100에서 ToMP-50와 ToMP-101 모두 AUC 점수 70% 이상을 기록했으며, ToMP-101은 슈퍼디엠프(SuperDiMP)와 동률을 이뤘고, 트랜스티(TransT)를 약간 앞서는 성능을 보였다.
- NFS 데이터셋에서 ToMP-101은 킵트랙(KeepTrack)을 +0.5% AUC 높게 기록하여 빠른 움직임과 간섭물이 많은 시퀀스에서 뛰어난 성능을 입증했다.
- 절단 실험 결과, 새로운 위치 인코딩과 이중 가중치 예측 메커니즘이 성능 향상에 크게 기여하는 것으로 확인되었다.
- ToMP는 라솔트(LaSOT) 데이터셋의 모든 속성에서 모든 트랜스포머 기반 추적기보다 뛰어나며, 다양한 추적 과제에 걸쳐 광범위한 강건성을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.