[논문 리뷰] Temporal Aggregation for Adaptive RGBT Tracking
이 논문은 시간 정보를 통합함으로써 정적 공간적 외관 모델링을 초월해 안정성을 향상시키는 새로운 RGBT 추적 프레임워크인 TAAT을 제안한다. 시간적 상호작용 집합 모듈(TIAM)과 경량 DFM 네트워크를 통한 적응형 결합 수준 융합을 통해 이루어진다. 공간-시간 외관 모델링과 모odal별 반응 가중치를 활용함으로써, TAAT은 VOT-RGBT2019, GTOT, RGBT210에서 최신 기술 수준의 성능을 달성하였으며, VOT-RGBT2019에서 0.4164의 EAO 스코어를 기록하여 기준 모델 대비 2.84% 향상되었다.
Visual object tracking with RGB and thermal infrared (TIR) spectra available, shorted in RGBT tracking, is a novel and challenging research topic which draws increasing attention nowadays. In this paper, we propose an RGBT tracker which takes spatio-temporal clues into account for robust appearance model learning, and simultaneously, constructs an adaptive fusion sub-network for cross-modal interactions. Unlike most existing RGBT trackers that implement object tracking tasks with only spatial information included, temporal information is further considered in this method. Specifically, different from traditional Siamese trackers, which only obtain one search image during the process of picking up template-search image pairs, an extra search sample adjacent to the original one is selected to predict the temporal transformation, resulting in improved robustness of tracking performance.As for multi-modal tracking, constrained to the limited RGBT datasets, the adaptive fusion sub-network is appended to our method at the decision level to reflect the complementary characteristics contained in two modalities. To design a thermal infrared assisted RGB tracker, the outputs of the classification head from the TIR modality are taken into consideration before the residual connection from the RGB modality. Extensive experimental results on three challenging datasets, i.e. VOT-RGBT2019, GTOT and RGBT210, verify the effectiveness of our method. Code will be shared at extcolor{blue}{\emph{https://github.com/Zhangyong-Tang/TAAT}}.
연구 동기 및 목표
- 정적 공간적 외관 모델링을 초월해 시간적 맥락을 통합함으로써 RGBT 추적의 안정성을 향상시키기 위해.
- 깊고 복잡한 융합 네트워크를 피하고 경량적이고 적응형 결합 수준 융합을 사용함으로써 RGBT 데이터셋이 제한된 상황을 해결하기 위해.
- 픽셀 수준이나 특징 수준 융합에서 발생하는 정렬 오류와 노이즈 문제를 줄이기 위해, 결합 수준에서 모odal에 적응하는 융합 메커니즘을 설계하기 위해.
- 장기적이고 도전적인 시퀀스에서 시간 모델링이 추적 성능을 크게 향상시킨다는 것을 검증하기 위해.
제안 방법
- 연속적인 검색 이미지 간의 시간적 변환을 학습함으로써 단일 프레임의 공간적 특징을 초월한 외관 모델링을 향상시키는 시간적 상호작용 집합 모듈(TIAM)을 도입한다.
- 분류 점수를 RGB 및 TIR 브랜치에서 동적으로 가중치를 부여함으로써 모달 신뢰도에 따라 적응형으로 모달 인식에 특화된 융합을 수행하는 경량 결정 융합 모듈(DFM)을 활용한다.
- RGB 및 TIR 입력을 위한 이중 스트림 특징 추출을 수행하는 시아미즈 유사 추적 백본을 사용하며, 넥 모듈을 통해 특징를 정제한다.
- 두 단계 추적 헤드를 적용한다: 첫 번째로, 모달별 분류 헤드가 반응 맵을 생성하고, 두 번째로, DFM이 학습 가능한 어텐션을 사용하여 이러한 맵을 융합하여 최종 예측을 도출한다.
- 모든 모달 점수를 입력으로 받아 가중 조합을 출력하는 다층 퍼셉트론 구조를 갖춘 DFM을 설계하여 동적 융합을 가능하게 한다.
- 분류 헤드에서 교차 엔트로피 손실을 사용하여 전체 네트워크를 엔드 투 엔드로 훈련하며, 다양한 모달과 시간에 걸쳐 정확하고 안정적인 객체 위치 추적을 최적화한다.
실험 결과
연구 질문
- RQ1연속 프레임 간의 시간 맥락을 통합함으로써 정적 외관 모델링을 초월해 RGBT 추적의 안정성을 향상시킬 수 있는가?
- RQ2낮은 데이터의 RGBT 추적 환경에서 전통적인 특징 수준 또는 픽셀 수준 융합보다 적응형 결합 수준 융합이 더 우수한 성능을 내는가?
- RQ3복잡한 네트워크 깊이 없이도 RGB와 TIR 모달 간의 보완적 특징을 효과적으로 활용할 수 있는 경량적이고 학습 가능한 융합 모듈(DFM)의 효과는 어떠한가?
- RQ4시간 모델링이 도전적인 추적 시퀀스에서 가림 및 배경 혼잡성에 대한 민감도를 얼마나 줄이는가?
- RQ5결합 수준에서 단순하지만 효과적인 융합 전략이 표준 RGBT 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- VOT-RGBT2019에서 TAAT은 0.4164의 EAO 스코어를 기록하여 기준 추적기 대비 2.84% 향상되었으며, 시간 모델링의 효과를 입증한다.
- DFM 구성 요소만으로도 VOT-RGBT2019에서 EAO가 1.22% 향상되었으며, 단순 평균화보다 적응형이고 모달에 특화된 융합의 유용성을 확인한다.
- TIAM과 DFM의 조합이 가장 높은 성능을 내며, GTOT에서 기준 모델 대비 1.8% 향상되었으며, 시간적 융합과 적응형 융합 간의 상호보완성을 검증한다.
- 정성적 결과에서는 DFM이 가림되거나 혼잡한 환경에서 보완적인 열화상 및 RGB 신호를 활용하여 오분류를 효과적으로 억제함을 보여준다.
- 제거 실험 결과, TIAM과 DFM 둘 다 필수적임을 확인하였다. 둘 중 하나를 제거하면 특히 장기 추적 및 복잡한 시나리오에서 성능이 크게 저하된다.
- 분류 손실의 시각화 결과, DFM은 한 모달이 열악한 조건(예: 저조도에서 RGB 또는 가림)에 놓일 경우에도 더 날카롭고 구분력 있는 반응 맵을 생성함을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.