Skip to main content
QUICK REVIEW

[논문 리뷰] RGB-T Object Tracking:Benchmark and Baseline

Chenglong Li, Xinyan Liang|arXiv (Cornell University)|2018. 05. 23.
Video Surveillance and Tracking Methods참고 문헌 48인용 수 14
한 줄 요약

이 논문은 234K 프레임을 포함하고 있으며, 고정밀도 모odal alignment과 가림 처리(annotation)를 갖춘 대규모 RGB-T 추적 벤치마크인 RGBT234를 소개한다. 또한 패치 수준의 그래프 구조와 적응형 융합을 통해 동적 객체 표현을 학습하는 그래프 기반 추적기(SGT)를 제안하며, 가림, 저조도, 카메라 운동과 같은 도전적인 상황에서 최신 기법들을 능가하는 성능을 보인다.

ABSTRACT

RGB-Thermal (RGB-T) object tracking receives more and more attention due to the strongly complementary benefits of thermal information to visible data. However, RGB-T research is limited by lacking a comprehensive evaluation platform. In this paper, we propose a large-scale video benchmark dataset for RGB-T tracking.It has three major advantages over existing ones: 1) Its size is sufficiently large for large-scale performance evaluation (total frame number: 234K, maximum frame per sequence: 8K). 2) The alignment between RGB-T sequence pairs is highly accurate, which does not need pre- or post-processing. 3) The occlusion levels are annotated for occlusion-sensitive performance analysis of different tracking algorithms.Moreover, we propose a novel graph-based approach to learn a robust object representation for RGB-T tracking. In particular, the tracked object is represented with a graph with image patches as nodes. This graph including graph structure, node weights and edge weights is dynamically learned in a unified ADMM (alternating direction method of multipliers)-based optimization framework, in which the modality weights are also incorporated for adaptive fusion of multiple source data.Extensive experiments on the large-scale dataset are executed to demonstrate the effectiveness of the proposed tracker against other state-of-the-art tracking methods. We also provide new insights and potential research directions to the field of RGB-T object tracking.

연구 동기 및 목표

  • RGB-T 객체 추적을 위한 종합적이고 대규모 평가 플랫폼의 부족을 해결하기 위해.
  • 기존 데이터셋의 한계, 즉 소규모, 정확도가 떨어지는 모달리티 정렬, 부족한 속성 annotation 등을 극복하기 위해.
  • RGB-T 추적 알고리즘에 대한 대규모이고 신뢰할 수 있는 평가를 가능하게 하기 위해 표준화된 벤치마크를 제공하기 위해.
  • 어려운 조건에서 강력한 추적을 위해 효과적인 융합 전략과 특징 표현 기법을 조사하기 위해.
  • 적응형 융합과 배경 억제와 같은 핵심 구성 요소들이 RGB-T 추적 성능 향상에 기여하는 방식에 대한 새로운 통찰을 제공하기 위해.

제안 방법

  • 234개의 RGB-T 영상 시퀀스(총 234K 프레임, 최대 8K 프레임/시퀀스)를 포함하는 대규모 영상 벤치마크인 RGBT234를 제안한다.
  • 이미지 패치를 노드로 삼고, 그래프 구조, 노드 가중치, 엣지 가중치를 ADMM 기반 최적화를 통해 동적으로 학습하는 그래프 기반 객체 표현을 도입한다.
  • RGB와 열화상 특징의 적응형 융합을 위해 최적화 프레임워크에 모달리티 가중치를 통합한다.
  • 패치 수준의 특징 표현과 학습된 가중치를 사용하여 배경 오염을 억제하는 구조적 서포트 벡터 머신을 활용한 온라인 추적을 수행한다.
  • 공간적 및 외관 유사도를 기반으로 패치 가중치를 계산하기 위해 반감독 학습(예: 다각형 순서화)을 활용한다.
  • 그래프 구조, 노드/엣지 가중치, 모달리티 융합 계수를 동시에 최적화하기 위해 통합된 ADMM 프레임워크를 적용한다.

실험 결과

연구 질문

  • RQ1가림, 저조도, 카메라 운동과 같은 다양한 도전적 속성에서 RGB-T 추적기의 성능는 어떻게 변하는가?
  • RQ2직접 연결 또는 고정 가중치 융합 대비, RGB와 열화상 모달리티의 적응형 융합이 추적의 강건성에 미치는 영향은 무엇인가?
  • RQ3가중치가 부여된 패치 표현과 그래프 기반 모델링이 추적 정확도 향상과 모델 이탈 감소에 얼마나 기여하는가?
  • RQ4저해상도 또는 변형이 있는 목표물 처리에서, 딥 러닝 기반 추적기 대비 비딥 러닝 기반 방법(예: SGT)의 효과성은 어떠한가?
  • RQ5적응형 융합, 배경 억제, 강력한 특징 학습 중 어떤 구성 요소가 RGB-T 추적 성능 향상에 가장 중요한가?

주요 결과

  • 저조도, 부분적 가림, 배경 혼잡도 상황에서 열화상 데이터가 소형 또는 변형된 목표물에 대해 추적 성능을 크게 향상시킨다.
  • 제안된 SGT 추적기가 가림, 카메라 운동, 배경 혼잡도 등 다양한 속성에서 최신 기법들을 능가하는 성능을 보인다.
  • 학습된 모달리티 가중치를 통한 RGB와 열화상 모달리티의 적응형 융합이 일관되게 성능 향상을 이끌지만, 직접 융합(예: CFnet+RGBT)은 종종 성능이 열 劣하다.
  • 가중치가 부여된 패치 표현(예: SGT, SOWP+RGBT)이 배경 간섭을 효과적으로 억제하고 모델 이탈을 감소시킨다.
  • 딥 러닝 기반 추적기(예: ECO, C-COT)는 분류 능력이 뛰어난 특징 학습 덕분에 척도 변화와 운동 블러를 더 잘 처리한다.
  • 복잡한 환경에서 단순한 특징 연결보다 패치 가중치와 세그먼테이션 마스크를 통한 배경 억제가 더 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.