Skip to main content
QUICK REVIEW

[논문 리뷰] RGB-T Tracking via Multi-Modal Mutual Prompt Learning

Yang Luo, Xiqing Guo|arXiv (Cornell University)|2023. 08. 31.
Video Surveillance and Tracking Methods인용 수 4
한 줄 요약

이 논문은 다중 모달 상호 프롬프트 학습 추적기(MPLT)를 제안하며, 다중 헤드 어텐션 기반 프롬프터를 갖춘 이중 브랜치 시아모이즈 비전 트랜스포머를 통해 가시광선 및 열화상 모달 간 이중 방향, 경량 특징 융합을 가능하게 하는 새로운 RGB-T 추적 프레임워크이다. 이 방법은 LasHeR 및 RGBT210를 포함한 여러 벤치마크에서 최신 기술 수준의 성능을 달성하며, 높은 추론 속도와 낮은 계산 비용을 제공한다.

ABSTRACT

Object tracking based on the fusion of visible and thermal im-ages, known as RGB-T tracking, has gained increasing atten-tion from researchers in recent years. How to achieve a more comprehensive fusion of information from the two modalities with fewer computational costs has been a problem that re-searchers have been exploring. Recently, with the rise of prompt learning in computer vision, we can better transfer knowledge from visual large models to downstream tasks. Considering the strong complementarity between visible and thermal modalities, we propose a tracking architecture based on mutual prompt learning between the two modalities. We also design a lightweight prompter that incorporates attention mechanisms in two dimensions to transfer information from one modality to the other with lower computational costs, embedding it into each layer of the backbone. Extensive ex-periments have demonstrated that our proposed tracking ar-chitecture is effective and efficient, achieving state-of-the-art performance while maintaining high running speeds.

연구 동기 및 목표

  • RGB-T 추적에서 가시광선 및 열화상 이미지 모달 간 효율적이고 효과적인 융합에 도전한다.
  • 단방향 프롬프트 학습 및 고정된 백본 아키텍처의 한계를 극복하여 계산 비용을 줄이고 모달 간 상호작용을 향상시킨다.
  • 특징 추출 중 이중 방향, 다중 수준 특징 교환을 가능하게 하는 경량이며 학습 가능한 프롬프트 모듈을 설계한다.
  • 온라인 템플릿 업데이트 및 칼만 필터링을 통해 일조 변화, 가림, 열화상 크로스오버에 대한 강건성을 향상시킨다.
  • 최소한의 파라미터 증가와 낮은 FLOPS를 통해 높은 추적 정확도를 달성하고 실시간 배포를 가능하게 한다.

제안 방법

  • RGB 및 열화상 이미지를 별도로 처리하기 위해 비전 트랜스포머(ViT) 백본을 이중 브랜치 시아모이즈 아키텍처로 확장한다.
  • 토큰 수준 및 공간 수준 어텐션을 조합하여 모달 특화 가중치를 생성하는 다중 모달 시각 정보 프롬프터(MVIP)를 도입한다.
  • MVIP를 사용하여 한 모달의 특징을 적응적으로 주시하고, 가중치 덧셈을 통해 다른 모달의 특징 맵에 주입한다.
  • 프롬프트 출력을 백본의 레이어 출력과 통합하여 특징 맵 간 계층적, 다중 수준 융합을 가능하게 한다.
  • 분류 신뢰도 기반의 온라인 템플릿 업데이트 전략을 적용하여 외형 변화에 적응한다.
  • 가려짐 및 운동 블러 상황에서의 강건성을 향상시키기 위해 예측 박스 정밀도 향상을 위해 칼만 필터링을 통합한다.

실험 결과

연구 질문

  • RQ1단방향 또는 직접 연결 방식과 비교해 볼 때, 이중 방향, 경량 프롬프트 학습이 RGB-T 추적에서 특징 융합에 개선을 이끌 수 있는가?
  • RQ2프롬프트 모듈에 다중 헤드 어텐션 기반 기법을 통합함으로써 교차 모달 특징 정렬 및 표현 품질이 향상되는가?
  • RQ3최소한의 파라미터를 갖는 학습 가능한 프롬프터가 고정 백본 방법과 비교해 성능을 유사하거나 뛰어나게 하면서 GPU 메모리 사용량을 줄일 수 있는가?
  • RQ4제안된 온라인 템플릿 업데이트 및 칼만 필터링 정밀도 향상 전략이 외형 변화 및 가림 상황에 얼마나 효과적인가?
  • RQ5상호 프롬프트 학습 메커니즘이 저조도, 열화상 크로스오버, 빠른 운동과 같은 어려운 상황에서 강건성을 얼마나 향상시키는가?

주요 결과

  • LasHeR 데이터셋에서 MPLT는 72.0% PR 및 57.1% SR을 달성하여 ViPT, TBSI, MACFT와 같은 최신 기술 수준의 방법들을 능가한다.
  • RGBT210 데이터셋에서 MPLT는 86.2% PR 및 63.0% SR을 기록하며 CAT, DMCNet, mfDiMP와 같은 모든 비교 방법들을 앞선다.
  • 절단 실험 결과, MVIP 모듈을 제거할 경우 PR은 6.1% 감소하고 SR은 5.6% 감소하여 그 핵심적인 역할을 확인한다.
  • MVIP에서 공간 또는 토큰 어텐션을 제거하면 PR이 3.5–4.7% 감소하며, 이는 두 어텐션 메커니즘이 효과적인 융합을 위해 필수적임을 시사한다.
  • 백본을 고정시킬 경우 PR은 3.8% 감소하고 SR은 3.1% 감소하지만, MPLT-F 역시 ViPT를 능가하여 상호 프롬프트 설계의 강건성을 입증한다.
  • MPLT는 오직 97M개의 학습 가능한 파라미터와 58.7G FLOPS만을 사용하며, TBSI(307M 파라미터, 82.2G FLOPS)보다 현저히 낮아 뛰어난 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.