Skip to main content
QUICK REVIEW

[논문 리뷰] SiamMan: Siamese Motion-aware Network for Visual Tracking

Wenzhang Zhou, Longyin Wen|arXiv (Cornell University)|2019. 12. 11.
Video Surveillance and Tracking Methods참고 문헌 39인용 수 9
한 줄 요약

SiamMan는 목표물의 이동 변화와 가림 현상에 대한 강건성을 향상시키기 위해 잠재적 위치 분류 브랜치를 통합한 시아모이즈 운동 인식 네트워크를 제안한다. 이는 앵커 박스 의존도를 줄이며, 전역적 맥락 모듈과 다중 척도 학습 가능한 주의 모듈을 결합하여 네 가지 벤치마크에서 최신 기술 수준의 성능을 달성하며, 추론 속도는 45 FPS이다.

ABSTRACT

In this paper, we present a novel siamese motion-aware network (SiamMan) for visual tracking, which consists of the siamese feature extraction subnetwork, followed by the classification, regression, and localization branches in parallel. The classification branch is used to distinguish the foreground from background, and the regression branch is adopt to regress the bounding box of target. To reduce the impact of manually designed anchor boxes to adapt to different target motion patterns, we design the localization branch, which aims to coarsely localize the target to help the regression branch to generate accurate results. Meanwhile, we introduce the global context module into the localization branch to capture long-range dependency for more robustness in large displacement of target. In addition, we design a multi-scale learnable attention module to guide these three branches to exploit discriminative features for better performance. The whole network is trained offline in an end-to-end fashion with large-scale image pairs using the standard SGD algorithm with back-propagation. Extensive experiments on five challenging benchmarks, i.e., VOT2016, VOT2018, OTB100, UAV123 and LTB35, demonstrate that SiamMan achieves leading accuracy with high efficiency. Code can be found at https://isrc.iscas.ac.cn/gitlab/research/siamman.

연구 동기 및 목표

  • 빠른 운동, 가림, 척도 변화와 같은 상황에서 앵커 기반 회귀의 한계를 해결한다.
  • 회귀를 지시하기 위해 원시 목표물 위치를 제공하는 위치 분류 브랜치를 도입함으로써 수동으로 설계된 앵커 박스 의존도를 줄인다.
  • 장거리 상관관계를 포착하기 위해 위치 분류 브랜치에 전역 맥락 모듈을 통합하여 큰 목표물 이동에 대한 강건성을 향상시킨다.
  • 다중 척도 학습 가능한 주의 모듈을 통해 다양한 척도에서의 특징 분류 능력을 향상시켜 분류, 회귀, 위치 분류 브랜치를 유도한다.
  • 대규모 데이터셋(_MS COCO, ImageNet, YouTube-BoundingBoxes_)을 사용해 오프라인 특징 학습을 위한 SGD와 역전파를 통한 엔드 투 엔드 훈련을 수행하며, 높은 효율성과 실시간 추론을 유지하면서도 여러 벤치마크에서 최신 기술 수준의 정확도를 확보한다.

제안 방법

  • 예시 영역과 검색 영역 쌍을 공유 백본에서 처리하기 위해 시아모이즈 특징 추출 하위 네트워크를 사용한다.
  • 세 개의 병렬 브랜치를 도입한다: 분류(전경/배경), 회귀(바운딩 박스 예측), 위치 분류(원시 목표물 위치 분류).
  • 장거리 공간적 상관관계를 모델링하기 위해 위치 분류 브랜치에 전역 맥락 모듈을 통합하여 큰 이동에 대한 강건성을 향상시킨다.
  • 다양한 척도에서 특징을 동적으로 융합하여 모든 세 브랜치가 분류 능력 있는 표현을 향해 유도하는 다중 척도 학습 가능한 주의 모듈을 설계한다.
  • 대규모 데이터셋(_MS COCO, ImageNet, YouTube-BoundingBoxes_)에서 SGD를 사용해 역전파를 통한 엔드 투 엔드 훈련을 수행한다.
  • 추론 중에는 첫 번째 프레임의 바운딩 박스만 예시로 사용하여 일회성 탐지 수행하며, 온라인 모델 업데이트 없이 진행한다.

실험 결과

연구 질문

  • RQ1원시 목표물 위치를 조건부로 분류하는 위치 분류 브랜치가 앵커 박스 의존도를 줄이고 어려운 운동 패tern 하에서 추적 정확도를 향상시키는가?
  • RQ2전역 맥락 모듈이 시각 추적에서 큰 목표물 이동에 대한 강건성을 향상시키는 데 얼마나 효과적인가?
  • RQ3다중 척도 학습 가능한 주의 모듈이 다양한 시각 추적 환경에서 특징 분류 능력과 추적 성능을 얼마나 향상시키는가?
  • RQ4제안된 SiamMan 프레임워크는 실시간 추론 속도를 유지하면서도 여러 표준 벤치마크에서 최신 기술 수준의 성능을 달성하는가?
  • RQ5개별 구성 요소(위치 분류, 전역 맥락, 주의)가 전체 추적 성능에 정량적으로 기여하는 정도는 어떠한가?

주요 결과

  • SiamMan는 VOT2016에서 EAO 점수 0.513을 달성하여 두 번째로 높은 성능을 낸 추적기 대비 8.9% 상대적 향상률을 기록했다.
  • VOT2018에서는 EAO 0.462를 기록하여 런업 추적기 대비 3.6% 상대적 향상률을 보이며 도전적인 조건에서도 뛰어난 성능을 입증했다.
  • 제거 실험 결과, 위치 분류 브랜치를 제거하면 VOT2016에서 EAO가 0.024 감소하고 VOT2018에서는 0.017 감소하여 그 핵심적 역할을 확인했다.
  • 전역 맥락 모듈을 제거할 경우 VOT2016에서 EAO가 0.009 감소하고 VOT2018에서는 0.015 감소하여 그 기여도가 뚜렷하다.
  • 다중 척도 주의 모듈을 제거하면 VOT2016에서 EAO가 0.019 향상되고 VOT2018에서는 0.016 향상되어 특징 선택의 효과를 입증했다.
  • UAV123에서 최신 기술 수준의 성능을 기록하며, 45 FPS의 실시간 추론 속도를 유지하여 실용적 구현 가능성 확보.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.