Skip to main content
QUICK REVIEW

[논문 리뷰] Discriminative and Robust Online Learning for Siamese Visual Tracking

Jinghao Zhou, Peng Wang|arXiv (Cornell University)|2019. 09. 06.
Video Surveillance and Tracking Methods참고 문헌 21인용 수 5
한 줄 요약

이 논문은 Siamese 시각 추적을 위한 분류적이고 강력한 온라인 학습 모듈인 DROL을 제안한다. 이 모듈은 주의 메커니즘을 통해 특징 추출을 향상시키고, 적응형 필터 및 템플릿 업데이트를 통해 추적 성능을 향상시킨다. SiamRPN++와 통합되었을 때, 추가 학습 없이도 6개의 벤치마크에서 최신 기술 수준의 성능을 달성하며, LaSOT에서 53.7% AUC와 62.4% NPr를 기록하여 ATOM과 SiamRPN++를 능가한다.

ABSTRACT

The problem of visual object tracking has traditionally been handled by variant tracking paradigms, either learning a model of the object's appearance exclusively online or matching the object with the target in an offline-trained embedding space. Despite the recent success, each method agonizes over its intrinsic constraint. The online-only approaches suffer from a lack of generalization of the model they learn thus are inferior in target regression, while the offline-only approaches (e.g., convolutional siamese trackers) lack the target-specific context information thus are not discriminative enough to handle distractors, and robust enough to deformation. Therefore, we propose an online module with an attention mechanism for offline siamese networks to extract target-specific features under L2 error. We further propose a filter update strategy adaptive to treacherous background noises for discriminative learning, and a template update strategy to handle large target deformations for robust learning. Effectiveness can be validated in the consistent improvement over three siamese baselines: SiamFC, SiamRPN++, and SiamMask. Beyond that, our model based on SiamRPN++ obtains the best results over six popular tracking benchmarks and can operate beyond real-time.

연구 동기 및 목표

  • 고정된 오프라인 모델로 인해 간섭물과 큰 변형을 다루는 데 한계가 있는 Siamese 추적기의 문제를 해결하기 위해.
  • 재학습 없이도 비디오에 특화된 온라인 특징 학습을 Siamese 네트워크에 통합하기 위해.
  • 배경 인식 주의와 분류 점수 융합을 통해 분류 능력을 향상시키기 위해.
  • 온라인 분류기 신뢰도에 따라 지도되는 적응형 템플릿 업데이트를 통해 강건성을 향상시키기 위해.
  • 다양한 Siamese 추적기와 호환되는 플러그 앤 플레이 모듈을 개발하여 실시간 추론를 유지하기 위해.

제안 방법

  • L2 손실 하에 비디오 프레임에서 대상에 특화된 특징을 추출하기 위해 이중 주의 메커니즘을 갖춘 온라인 모듈을 도입한다.
  • 학습 가능한 가중치 λ를 사용해 온라인 분류기의 반응 맵과 Siamese 네트워크의 분류 점수를 융합하여 분류 능력을 향상시킨다.
  • 온라인 신뢰도 점수에 기반해 Siamese 네트워크의 분류 헤드를 업데이트함으로써 배경 노이즈에 적응하는 필터 업데이트 전략을 제안한다.
  • 간격 T마다 높은 신뢰도를 가진 프레임을 선택해 템플릿을 정교화하는 동적 단기 템플릿 업데이트 메커니즘을 구현한다.
  • 오프라인 Siamese 네트워크의 사전 학습된 임bedding 공간을 유지하면서 온라인 모듈을 엔드 투 엔드로 훈련하기 위해 이차 최적화 프레임워크를 사용한다.
  • 서로 독립적이고 모듈화된 두 개의 브랜치 아키텍처를 활용한다: 하나는 Siamese 매칭을 위해, 다른 하나는 온라인 특징 정밀화를 위해.

실험 결과

연구 질문

  • RQ1온라인 모듈과 주의 메커니즘을 통해 간섭물과 배경 혼잡 속에서 Siamese 추적기의 분류 능력이 향상될 수 있는가?
  • RQ2재학습 없이도 Siamese 네트워크에 온라인 학습을 통합할 수 있는가? 이때 사전 학습된 임베딩 공간의 강건성은 손상되지 않는가?
  • RQ3온라인 신뢰도에 기반한 적응형 필터 및 템플릿 업데이트가 큰 변형과 운동 흐림 상황에서 추적 강건성을 향상시키는가?
  • RQ4제안된 모듈은 재학습 없이도 다양한 Siamese 추적기에 일반적으로 적용 가능한가? 성능 저하나 속도 저하가 발생하는가?
  • RQ5추적 정확도와 안정성을 향상시키기 위해 Siamese와 온라인 분류기 점수 사이의 최적의 균형은 무엇인가?

주요 결과

  • ResNet50 백본을 사용한 DROL-RPN은 LaSOT에서 53.7% AUC와 62.4% NPr를 기록하며, 추가 구성 요소 없이도 ATOM과 SiamRPN++를 능가한다.
  • OTB100에서 이 방법은 동일한 백본을 사용한 SiamRPN++보다 AUC가 1.2% 높고, EAO가 1.8% 높다.
  • 절단 분석 결과, λ = 0.8일 때 Siamese와 온라인 분류기 점수 간 균형이 최적으로 맞춰져 있으며, λ = 1.0보다 AUC가 0.8% 높아진다.
  • 주의 모듈은 TrackingNet에서 NPr를 1.2% 향상시키며, MotorRolling 및 Coke와 같은 시퀀스에서 IoU 안정성을 향상시켜 드리프트를 감소시킨다.
  • T = 5(매 5프레임마다)로 설정한 템플릿 업데이트는 T = 1보다 더 뛰어난 성능을 내며, 템플릿 드리프트를 감소시키고 장시간 시퀀스에서의 강건성을 향상시킨다.
  • 이 방법은 실시간 추론 속도를 유지하며, 표준 벤치마크에서 최소한의 계산 오버헤드로 실시간 초과 속도로 작동한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.