[논문 리뷰] Visible-Thermal UAV Tracking: A Large-Scale Benchmark and New Baseline
이 논문은 500개의 고해상도(1920×1080) RGB-T 시퀀스로 구성된 대규모 가시-열화상 드론 추적 벤치마크인 VTUAV를 소개한다. 총 170만 프레임으로 구성되며, 단기 추적, 장기 추적, 인스턴스 세그멘테이션을 지원한다. 계층적 다중 모odal 융합 추적기(HMFT)를 제안하여 이미지, 특징, 결정 수준 융합을 통합하여 여러 벤치마크에서 새로운 최고 성능을 기록했으며, 장기 추적에서 MSR 46.1%, MPR 53.6%의 성능을 달성했다.
With the popularity of multi-modal sensors, visible-thermal (RGB-T) object tracking is to achieve robust performance and wider application scenarios with the guidance of objects' temperature information. However, the lack of paired training samples is the main bottleneck for unlocking the power of RGB-T tracking. Since it is laborious to collect high-quality RGB-T sequences, recent benchmarks only provide test sequences. In this paper, we construct a large-scale benchmark with high diversity for visible-thermal UAV tracking (VTUAV), including 500 sequences with 1.7 million high-resolution (1920 $ imes$ 1080 pixels) frame pairs. In addition, comprehensive applications (short-term tracking, long-term tracking and segmentation mask prediction) with diverse categories and scenes are considered for exhaustive evaluation. Moreover, we provide a coarse-to-fine attribute annotation, where frame-level attributes are provided to exploit the potential of challenge-specific trackers. In addition, we design a new RGB-T baseline, named Hierarchical Multi-modal Fusion Tracker (HMFT), which fuses RGB-T data in various levels. Numerous experiments on several datasets are conducted to reveal the effectiveness of HMFT and the complement of different fusion types. The project is available at here.
연구 동기 및 목표
- RGB-T 추적에서 품질 높은 쌍체 학습 데이터의 부족 문제를 해결하기 위해 대규모, 다양한, 고해상도의 벤치마크를 구축한다.
- 단기 추적, 장기 추적, 인스턴스 세그멘테이션을 아우르는 RGB-T 추적기의 종합적 평가를 가능하게 한다.
- 프레임 수준 및 시퀀스 수준에서 세분화된, 군집형에서 세분화된 속성 주석을 제공하여 도전 과제에 특화된 추적기 개발을 지원한다.
- 다중 수준에서 다중 모달 정보를 효과적으로 융합하는 새로운 강력한 RGB-T 추적 기반(HMFT)을 설계한다.
제안 방법
- 500개의 다양한 드론 시퀀스, 총 170만 프레임의 고해상도(1920×1080) RGB-T 프레임 쌍을 포함한 대규모 벤치마크인 VTUAV를 구축한다. 다양한 환경와 도전 과제를 수반한다.
- 이미지 융합, 특징 융합, 결정 융합을 통합하는 계층적 다중 모달 융합 프레임워크(HMFT)를 제안하여 RGB-T 추적에 적용한다.
- 프레임 수준과 시퀀스 수준에서 13종의 도전 과제 유형(예: 가림, 조명 변화, 운동 왜곡 등)을 포함한 군집형에서 세분화된 속성 주석 체계를 도입한다.
- 단기 추적(기본 HMFT)과 장기 추적(HMFT_LT)을 위한 별도의 변종을 설계하여 재감지 및 메모리 메커니즘을 통합한다.
- 다단계 융합 전략을 사용한다: 초기 융합(이미지 수준), 중간 수준의 특징 융합, 후기 융합(결정 수준) 및 적응형 융합 모듈을 포함한다.
- GTOT, RGBT210, RGBT234, VTUAV 등 여러 벤치마크에서 표준화된 지표(예: MSR, MPR, EAO)를 사용해 HMFT의 성능을 평가한다.
실험 결과
연구 질문
- RQ1제안된 HMFT 추적기가 다양한 추적 시나리오에서 정확도와 강건성 측면에서 최신 기술 대비 어떻게 성능을 냈는가?
- RQ2이미지 수준, 특징 수준, 결정 수준 융합 전략이 RGB-T 추적 성능에 얼마나 기여하는가?
- RQ3제안된 VTUAV 벤치마크가 단기, 장기, 세그멘테이션 작업을 아우르는 RGB-T 추적기의 종합적 평가를 지원할 수 있는가?
- RQ4군집형에서 세분화된 속성 주석 체계가 도전 과제에 특화된 추적기 개발에 얼마나 효과적인가?
주요 결과
- HMFT_LT는 장기 추적에서 MSR 46.1%, MPR 53.6%를 기록하여 이전 최고 성능 추적기(FSRPN) 대비 MSR 14.7%, MPR 17.0% 향상하여 새로운 SOTA 성능을 달성했다.
- 제안된 HMFT 기반 추적기는 장기 추적 서브셋에서 MSR 35.5%, MPR 41.4%를 기록하여 다중 수준에서의 계층적 융합의 효과를 입증했다.
- 이미지 수준 융합(CIF)과 특징 수준 융합(DFF) 각각이 단일 모odal DiMP 대비 MSR에서 3.2%, 4.4% 향상되었으며, 적응형 결정 융합(ADF)을 통한 병합 융합은 MSR 및 MPR에서 각각 2.6%, 2.7% 향상시켰다.
- VTUAV-V 서브셋(가시성 전용)에서 트랜스포머 기반 추적기인 STARK는 SR 64.9%, PR 75.3%를 기록하여 주의 메커니즘이 시각 추적에서 강력한 성능을 발휘함을 시사한다.
- 장기 추적기(LTMU, GlobalTrack, SPLT)는 재감지 및 메모리 메커니즘 덕분에 장기 평가에서 다른 추적기들보다 뚜렷한 성능 우위를 보이며, 이러한 구성 요소의 중요성을 확인한다.
- 절단 실험 결과, 단순히 보완적이고 분류 능력이 뛰어난 브랜치의 출력을 평균화하는 것만으로는 성능 저하가 발생하므로, 적응형 가중치를 적용한 결정 융합(ADF)이 핵심임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.