[논문 리뷰] Learning to Filter: Siamese Relation Network for Robust Tracking
이 논문은 메타학습 기반의 관계 탐지기와 분류 및 회귀 브랜치를 동시에 보정하는 보완 모듈을 도입하여 시각 추적의 강인성을 향상시키는 시ames 트랙커 관계 네트워크(SRN)를 제안한다. 제안된 방법은 VOT2018, VOT2019, OTB100, LaSOT, UAV123 등 다섯 가지 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 실시간 추론 속도를 유지하면서도 가림, 급속한 운동, 배경 혼잡 등의 조건에서도 정확도가 향상된다.
Despite the great success of Siamese-based trackers, their performance under complicated scenarios is still not satisfying, especially when there are distractors. To this end, we propose a novel Siamese relation network, which introduces two efficient modules, i.e. Relation Detector (RD) and Refinement Module (RM). RD performs in a meta-learning way to obtain a learning ability to filter the distractors from the background while RM aims to effectively integrate the proposed RD into the Siamese framework to generate accurate tracking result. Moreover, to further improve the discriminability and robustness of the tracker, we introduce a contrastive training strategy that attempts not only to learn matching the same target but also to learn how to distinguish the different objects. Therefore, our tracker can achieve accurate tracking results when facing background clutters, fast motion, and occlusion. Experimental results on five popular benchmarks, including VOT2018, VOT2019, OTB100, LaSOT, and UAV123, show that the proposed method is effective and can achieve state-of-the-art results. The code will be available at https://github.com/hqucv/siamrn
연구 동기 및 목표
- 배경 혼잡, 가림, 급속한 운동과 같은 복잡한 상황에서 시ames 트랙커의 제한된 강인성을 해결하기 위해.
- 같은 목표물만 매칭하는 것이 아니라 간섭물과의 구별 능력을 향상시켜 분별력을 향상시키기 위해.
- 분류 및 회귀 브랜치 간의 불일치를 통합 최적화를 통해 줄이기 위해.
- 초기 목표물 정렬 후 추가 미세조정 없이도 간섭물을 필터링할 수 있도록 하기 위해.
제안 방법
- 소수의 샘플로 학습하는 메타학습 기반의 대비 학습을 통해 목표물과 제안 영역 특징 간의 관계를 측정하는 관계 탐지기(RD)를 도입한다.
- 분류 점수와 RD 출력을 융합하여 바운딩 박스 예측을 공동으로 보완하는 보완 모듈(RM)을 활용한다.
- 학습 중 삼중체 기반의 대비 손실을 적용하여 목표물과 배경 샘플 간의 유사성과 이질성을 동시에 학습한다.
- 학습 중 어려운 음성 샘플을 강제로 선택하는 하드 음성 마이닝을 적용하여 모델 강인성을 향상시킨다.
- 다양한 수준의 특징 집합(각각 conv3, conv4, conv5에서 유도)과 다수의 관계 헤드 유형(Global, Local, Patch)을 활용하여 포괄적인 특징 비교를 수행한다.
- 추론 중 정밀한 ROI 풀링을 적용하여 제안 영역 특징을 추출하고, 이를 RD에 입력한다.
![Figure 1: Tracking Result of our Siamese relation network with two state-of-the-art trackers in VOT2018 [ 21 ] . Benefiting from our Relation Detector and Refinement Module, when facing similar distractors, appearance change and complex background, our tracker is more robust to these challenges and](https://ar5iv.labs.arxiv.org/html/2104.00829/assets/x1.png)
실험 결과
연구 질문
- RQ1메타학습 기반의 관계 탐지기가 추가 미세조정 없이 배경에서 간섭물을 효과적으로 필터링할 수 있는가?
- RQ2보완 모듈을 통한 분류 및 회귀의 통합 최적화가 이 브랜치 간 불일치를 어떻게 줄이는가?
- RQ3복잡한 시각 조건 하에서 대비 학습 전략이 시ames 트랙커의 분별력 향상에 얼마나 기여하는가?
- RQ4특징 수준 및 관계 헤드 유형의 최적 조합은 간섭물과 목표물의 구별에 얼마나 기여하는가?
주요 결과
- 제안된 방법은 VOT2018, VOT2019, OTB100, LaSOT, UAV123 등 다섯 가지 표준 벤치마크에서 최신 기술 수준 성능을 달성한다.
- OTB100에서 전체 특징 집합과 세 가지 관계 헤드 유형(Gloabal, Local, Patch)을 사용할 경우 AUC 점수가 0.701을 기록한다.
- 대비 학습 전략은 단순한 한 번의 샘플 학습 방식 대비 AUC 점수를 1.3% 향상시켜 분별력 향상을 입증한다.
- 하드 음성 마이닝은 AUC 점수를 추가로 0.3% 향상시켜 어려운 샘플에 대한 강인성을 향상시킨다.
- conv4와 conv5 특징의 조합이 두 수준의 특징 집합에서 최고의 성능을 내며, 세 수준의 특징 집합이 전체 AUC에서 최고 성능을 기록한다.
- 기존의 시ames 트랙커보다 가림, 운동 블러, 배경 혼잡 상황에서 뛰어난 성능을 보이며, 동시에 실시간 추론 속도를 유지한다.
![Figure 2: The tracking pipeline of the proposed Siamese Relation Network. The proposed Relation detector (RD) and joint Refinement Module (RM) are presented. During tracking, we feed the features of proposals that are generated from the regression branch by precise ROI pooling [ 6 ] into RD to measu](https://ar5iv.labs.arxiv.org/html/2104.00829/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.