[논문 리뷰] Jointly Modeling Motion and Appearance Cues for Robust RGB-T Tracking
이 논문은 RGB-T 추적 프레임워크인 JMMAC을 제안하며, 새로운 후기 융합 네트워크(MFNet)를 사용해 RGB와 열화상 응답을 적응적으로 통합함으로써 외관과 운동 신호를 공동으로 모델링한다. 목표물과 카메라 운동 모델을 동적 트래커 스위처와 통합함으로써, 세 가지 RGB-T 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, EAO 및 내성적 안정성 측면에서 기존 방법들보다 뚜렷한 우월성을 보였다.
In this study, we propose a novel RGB-T tracking framework by jointly modeling both appearance and motion cues. First, to obtain a robust appearance model, we develop a novel late fusion method to infer the fusion weight maps of both RGB and thermal (T) modalities. The fusion weights are determined by using offline-trained global and local multimodal fusion networks, and then adopted to linearly combine the response maps of RGB and T modalities. Second, when the appearance cue is unreliable, we comprehensively take motion cues, i.e., target and camera motions, into account to make the tracker robust. We further propose a tracker switcher to switch the appearance and motion trackers flexibly. Numerous results on three recent RGB-T tracking datasets show that the proposed tracker performs significantly better than other state-of-the-art algorithms.
연구 동기 및 목표
- 기존 RGB-T 트래커가 외관 신호에 크게 의존하고, 가림, 조명 변화, 열화상 교차 현상 등에서 실패하는 한계를 해결하기 위해.
- 전역 및 국소적 맥락을 기반으로 RGB와 열화상 응답을 적응적으로 가중하는 후기 융합 전략을 개발하여 다중 모odal 융합을 향상시키기 위해.
- 외관 신호가 열악한 상황(예: 가림, 블러)에서도 운동 신호를 통합함으로써 내성적 안정성을 향상시키기 위해.
- 실시간 신호 신뢰도에 따라 외관 기반 추적(JMMAC)과 운동 기반 추적(TMP + CME) 간에 민첩하게 전환할 수 있는 동적 트래커 스위처를 설계하기 위해.
제안 방법
- 외부에서 사전 학습된 네트워크를 사용해 전역 및 국소 융합 가중치를 학습하는 다중 모odal 융합 네트워크인 MFNet을 제안한다.
- RGB와 열화상 응답 맵의 가중 선형 조합을 사용하며, 융합 가중치는 MFNet에 의해 결정된다: $ \textbf{R}_F = w \times \textbf{R}_{RGB} + (1-w) \times \textbf{R}_T $.
- 실시간 신호 신뢰도에 따라 외관 기반 추적(JMMAC)과 운동 기반 추적(TMP + CME) 간에 선택하는 트래커 스위처를 도입한다.
- 이력 운동 패턴을 이용해 향후 목표물 위치를 추정하는 운동 예측 모듈을 통해 목표물 운동을 모델링한다.
- 아핀 변환을 사용해 카메라 운동을 추정하고, 운동 블러나 드리프트 상황에서도 추적 안정성을 확보한다.
- YOLOv2 기반의 박스 회귀 헤드를 사용해 경계 상자 보정을 수행하며, 계산 비용은 극히 낮다.
실험 결과
연구 질문
- RQ1학습된 전역 및 국소 융합 가중치에 의해 이른바 융합된 RGB와 열화상 모odal이, 초기 융합 또는 단순 평균화에 비해 추적의 내성적 안정성을 크게 향상시키는가?
- RQ2외관 신호가 가림이나 블러로 인해 신뢰할 수 없을 때, 목표물 및 카메라 운동 모델의 통합이 추적 정확도를 유지하는 데 얼마나 효과적인가?
- RQ3실시간 신호 신뢰도에 기반해 외관 기반과 운동 기반 추적 간에 전환하는 동적 트래커 스위처가 다양한 추적 과제에 걸쳐 전반적인 내성적 안정성을 향상시키는가?
- RQ4제안된 MFNet 융합 메커니즘이 다양한 데이터셋에 일반화되어 있으며, 정확성과 안정성 측면에서 기존 융합 전략을 초월하는가?
주요 결과
- MFNet은 VOT19-RGBT 데이터셋에서 EAO 점수 0.7835를 기록하여, 강도 기반 융합(0.7796)과 추적 품질 기반 융합(0.7454)과 같은 베이스라인 융합 방법들을 뚜렷이 앞서며 최고 성능을 기록했다.
- 트래커 스위처는 매개변수 변동에 매우 강건하며, 특히 $ t_{\text{diff}} $ 에 대해 넓은 매개변수 범위에서 높은 성능 유지를 보이며 과적합이 낮음을 시사했다.
- 카메라 운동 모델 중 아핀 변환 모델이 가장 우수한 성능을 보였으며, 이는 이동, 유사성, 투사 모델 대비 추적 정확도 향상을 이뤘다.
- 전반적인 JMMAC 트래커는 약 4 FPS로 실행되며, MFNet과 운동 모듈이 추가하는 계산 오버헤드는 극히 미미하여 실시간 적용에 실용적이다.
- GTOT, RGBT234, VOT19-RGBT에서 JMMAC는 경쟁하는 RGB-T 트래커들보다 항상 높은 EAO 점수를 기록하며 최신 기술 수준의 성능을 달성했다.
- 제거 실험(ablation study) 결과, MFNet과 운동 모델링 구성 요소가 모두 필수적임을 확인하였으며, 둘 중 하나를 제거하면 성능이 뚜렷이 저하되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.