[논문 리뷰] Ranking-Based Siamese Visual Tracking
이 논문은 배경 잡음에 대한 분별력을 향상시키고 분류와 정위치 간의 일치를 개선하기 위해 순위 기반 최적화(RBO) 프레임워크를 제안한다. 분류 순위 손실과 IoU 유도 순위 손실을 도입함으로써, 추적기의 강인성과 정확도를 향상시켜 일곱 개의 벤치마크에서 최신 기술 성능을 달성하며 추적기의 추론 오버헤드 없이 성능을 향상시킨다.
Current Siamese-based trackers mainly formulate the visual tracking into two independent subtasks, including classification and localization. They learn the classification subnetwork by processing each sample separately and neglect the relationship among positive and negative samples. Moreover, such tracking paradigm takes only the classification confidence of proposals for the final prediction, which may yield the misalignment between classification and localization. To resolve these issues, this paper proposes a ranking-based optimization algorithm to explore the relationship among different proposals. To this end, we introduce two ranking losses, including the classification one and the IoU-guided one, as optimization constraints. The classification ranking loss can ensure that positive samples rank higher than hard negative ones, i.e., distractors, so that the trackers can select the foreground samples successfully without being fooled by the distractors. The IoU-guided ranking loss aims to align classification confidence scores with the Intersection over Union(IoU) of the corresponding localization prediction for positive samples, enabling the well-localized prediction to be represented by high classification confidence. Specifically, the proposed two ranking losses are compatible with most Siamese trackers and incur no additional computation for inference. Extensive experiments on seven tracking benchmarks, including OTB100, UAV123, TC128, VOT2016, NFS30, GOT-10k and LaSOT, demonstrate the effectiveness of the proposed ranking-based optimization algorithm. The code and raw results are available at https://github.com/sansanfree/RBO.
연구 동기 및 목표
- Siamese 시각 추적에서 어려운 음성 샘플(배경 잡음)이 추적기를 오도할 수 있는 문제를 해결하기 위해.
- 기존 Siamese 추적기에서 분류 신뢰도와 정위치 정확도 간의 불일치 문제를 해결하기 위해.
- 학습 중 양성 및 음성 제안 영역 간의 관계를 명시적으로 모델링하여 모델 일반화 능력을 향상시키기 위해.
- 추론 비용을 증가시키지 않으면서 다양한 Siamese 추적기와 호환되는 즉시 적용 가능한 최적화 전략을 개발하기 위해.
제안 방법
- 분류를 순위 매기기 문제로 간주하여, 양성 샘플이 어려운 음성 샘플(잡음)보다 높은 순위를 차지하도록 보장하는 분류 순위 손실을 제안한다.
- 양성 샘플의 정위치 예측 IoU와 분류 신뢰도 점수를 일치시키는 IoU 유도 순위 손실을 도입한다.
- 기존 Siamese 추적기와 호환되도록 손실 함수를 설계하여 아키텍처 변경이나 추가 추론 계산이 필요 없도록 한다.
- 두 단계 최적화 전략을 적용한다: 첫 번째로 분류 순위 손실이 잡음에 대한 신뢰도를 억제하고, 두 번째로 IoU 유도 손실이 높은 신뢰도 예측이 잘 정위치되도록 보장한다.
- 기존 RankDetNet의 IoU-순위 손실을 수정하여 최적화를 두 개의 하위 작업으로 분리하고 명시적 제약 조건을 도입함으로써 학습 안정성과 성능을 향상시켰다.
- 앵커 기반(SiamRPN++) 및 앵커리스(SiamBAN) Siamese 추적기뿐 아니라 Transformer 기반(TransT) 추적기에서도 방법을 검증하였다.
실험 결과
연구 질문
- RQ1순위 기반 최적화 전략이 어려운 음성 샘플에 대한 Siamese 추적기의 분별력을 향상시킬 수 있는가?
- RQ2IoU와 분류 신뢰도를 일치시키는 것이 추론 비용 증가 없이 정위치 정확도를 향상시키는가?
- RQ3다양한 추적 벤치마크와 추적기 아키텍처에서 제안된 순위 기반 최적화의 효과는 어떠한가?
- RQ4순위 기반 최적화 전략이 Transformer 기반 시각 추적기로 일반화 가능한가?
주요 결과
- 제안된 RBO 방법은 TC128, NFS30, UAV123 벤치마크의 통합 평가에서 SiamRPN++의 성능을 60.63%에서 62.08%로 1.45% 향상시켰다.
- SiamBAN-RBO는 동일한 벤치마크 세트에서 61.15%에서 62.24%로 1.09% 향상되었다.
- 분류 순위 손실은 시각화 결과를 통해 잡음에 대한 신뢰도 억제에 효과적임을 입증하였으며, 이는 이중 단계 하드 음성 샘플 마이닝 기법을 능가한다.
- IoU 유도 순위 손실은 성능 향상에 크게 기여하였으며, 개선된 버전은 원본 RankDetNet 손실보다 더 나은 최적화 안정성 덕분에 성능이 뛰어나다.
- TransT+RBO는 LaSOT에서 AUC 0.7% 향상, UAV123에서 0.6% 향상하여 주목할 만한 성능 향상을 보였으며, 이는 주목할 만한 성능 향상을 보였다.
- 절단 실험 결과, 두 순위 손실이 성능 향상에 독립적이고 상호보완적으로 기여하며, 특히 IoU 유도 손실이 가장 큰 기여를 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.