Skip to main content
QUICK REVIEW

[논문 리뷰] M$^5$L: Multi-Modal Multi-Margin Metric Learning for RGBT Tracking

Zhengzheng Tu, Chun Lin|arXiv (Cornell University)|2020. 03. 17.
Video Surveillance and Tracking Methods참고 문헌 34인용 수 5
한 줄 요약

이 논문은 RGBT 추적을 위한 다중 모달 다중 간격 거리 학습 프레임워크인 M$^5$L을 제안한다. 이는 구조적 손실을 통해 혼동되는 양성 및 음성 샘플을 명시적으로 모델링하여 특징의 구분 능력을 향상시킨다. 모달리티별 간격과 교차 모달리티 제약 조건을 도입함으로써 M$^5$L은 대규모 벤치마크에서 최신 기술을 초월하는 성능을 보이며, RGBT234에서 정밀도 0.770, 성공도 0.521을 기록한다.

ABSTRACT

Classifying the confusing samples in the course of RGBT tracking is a quite challenging problem, which hasn't got satisfied solution. Existing methods only focus on enlarging the boundary between positive and negative samples, however, the structured information of samples might be harmed, e.g., confusing positive samples are closer to the anchor than normal positive samples.To handle this problem, we propose a novel Multi-Modal Multi-Margin Metric Learning framework, named M$^5$L for RGBT tracking in this paper. In particular, we design a multi-margin structured loss to distinguish the confusing samples which play a most critical role in tracking performance boosting. To alleviate this problem, we additionally enlarge the boundaries between confusing positive samples and normal ones, between confusing negative samples and normal ones with predefined margins, by exploiting the structured information of all samples in each modality.Moreover, a cross-modality constraint is employed to reduce the difference between modalities and push positive samples closer to the anchor than negative ones from two modalities.In addition, to achieve quality-aware RGB and thermal feature fusion, we introduce the modality attentions and learn them using a feature fusion module in our network. Extensive experiments on large-scale datasets testify that our framework clearly improves the tracking performance and outperforms the state-of-the-art RGBT trackers.

연구 동기 및 목표

  • 일반적인 양성 샘플이 혼동되는 양성 샘플보다 앵커에 더 가까운 경우가 많은 RGBT 추적에서 혼동되는 샘플 문제를 해결하기 위해.
  • 거리 학습 과정에서 샘플의 본질적 구조적 정보(예: 혼동되는 샘플과 일반적인 샘플 간의 상대적 거리)를 유지하기 위해.
  • RGB와 열화상 특징 간의 도메인 갭을 줄임으로써 교차 모달리티 정렬을 향상시키기 위해.
  • 학습 가능한 모달리티 주의 메커니즘을 사용하여 특징 융합 품질을 향상시키기 위해.
  • 혼동되는 샘플을 정의된 간격으로 명시적으로 일반 샘플과 분리하는 거리 학습 손실을 개발하기 위해.

제안 방법

  • 혼동되는 양성 샘플을 위한 구간 [α−β, α], 일반 양성 샘플을 위한 구간 [α, α+m], 혼동되는 음성 샘플을 위한 구간 [α+m, α+m+β]를 정의하는 다중 모달 다중 간격 구조적 손실(MMSL)을 제안한다.
  • 각 모달리티 내에서 혼동되는 샘플과 일반 샘플 간의 상대적 거리 구조를 유지하기 위해 모달리티별 간격 전략을 사용한다.
  • RGB와 열화상 모달리티 간의 임베딩을 정렬하기 위해 교차 모달리티 제약 조건을 도입하여, 서로 다른 모달리티 간에 양성 샘플이 앵커보다 더 가까워지도록 보장한다.
  • 목표에 대한 관련성에 따라 RGB와 열화상 특징을 적응적으로 융합하기 위해 학습 가능한 모달리티 주의 모듈을 활용한다.
  • 기본 앵커 기반 샘플링을 사용하는 트리플릿 유사 거리 학습 프레임워크를 적용하며, 진짜 타겟 바운딩 박스를 앵커로 간주한다.
  • MMSL, 모달리티별 분류 손실, 교차 모달리티 일致성 손실을 조합한 복합 손실을 최적화하여 네트워크를 학습시킨다.

실험 결과

연구 질문

  • RQ1표준 거리 학습을 넘어서 혼동되는 양성 및 음성 샘플을 명시적으로 모델링하면 RGBT 추적 성능 향상에 기여하는가?
  • RQ2혼동되는 샘플과 일반 샘플 간의 상대적 거리 구조를 유지하면 특징의 구분 능력이 향상되는가?
  • RQ3정의된 간격으로 혼동되는 샘플을 분리하는 다중 간격 손실 전략이 추적의 견고성을 향상시키는가?
  • RQ4교차 모달리티 제약 조건은 다중 모달 추적에서 정렬과 구분 능력에 어떤 영향을 미치는가?
  • RQ5학습 가능한 모달리티 주의 메커니즘은 특징 융합과 추적 정확도 향상에 어느 정도 기여하는가?

주요 결과

  • RGBT234 데이터셋에서 M$^5$L은 정밀도 0.770, 성공도 0.521을 기록하여 베이스라인 RT-MDNet(0.734 PR, 0.483 SR)을 능가한다.
  • 절단 실험 결과, 주의 기반 융합 모듈과 MMSL 손실 모두 필수적임을 확인하였으며, 둘 중 하나를 제거하면 성능이 크게 떨어진다.
  • 최적의 간격 $m = 0.2$가 가장 높은 성능을 보였으며, $m = 0$ 또는 $m = 0.4$보다 정밀도/성공도에서 3% 향상되어 간격 선택의 중요성을 입증한다.
  • 파라미터 $\beta = 0.1$가 가장 높은 성능을 기록하여, 고정된 간격으로 혼동 샘플을 최적화하는 것이 효과적이며 간격 크기에 민감함을 시사한다.
  • 교차 모달리티 손실 $L_{cross}$는 기여가 크며, 이와 같은 실험을 수행하지 않은 경우에 비해 GTOT에서 성공도 2.4% 향상되고 RGBT234에서 2.3% 향상된다.
  • 실행 시간 분석 결과, M$^5$L은 RGBT234에서 14 fps로 실행되며, 베이스라인 MDNet(1 fps)보다 빠르면서도 뛰어난 정확도를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.