Skip to main content
QUICK REVIEW

[논문 리뷰] Faster and Simpler Siamese Network for Single Object Tracking

Shaokui Jiang, Baile Xu|arXiv (Cornell University)|2021. 05. 07.
Video Surveillance and Tracking Methods참고 문헌 28인용 수 4
한 줄 요약

이 논문은 단일 객체 추적을 위한 더 빠르고 단순한 시AMESE 네트워크를 제안하며, 저사양 하드웨어에서도 실시간 성능을 달성하면서도 높은 정확도를 유지한다. 특징 보정을 위해 Squeeze-and-Excitation 블록을 통합하고, 커널 크기를 줄인 경량화된 상관관계 레이어를 사용하며, 회귀를 위해 1×1 합성곱층과 완전 연결층을 활용함으로써 정밀도를 희생시키지 않은 채 학습 및 추론 속도를 향상시킨다. VOT 및 OTB 벤치마크에서 상태최저 수준의 속도와 경쟁 가능한 정확도를 달성하였으며, 단지 5개의 에포크와 최소한의 데이터로 학습하였다.

ABSTRACT

Single object tracking (SOT) is currently one of the most important tasks in computer vision. With the development of the deep network and the release for a series of large scale datasets for single object tracking, siamese networks have been proposed and perform better than most of the traditional methods. However, recent siamese networks get deeper and slower to obtain better performance. Most of these methods could only meet the needs of real-time object tracking in ideal environments. In order to achieve a better balance between efficiency and accuracy, we propose a simpler siamese network for single object tracking, which runs fast in poor hardware configurations while remaining an excellent accuracy. We use a more efficient regression method to compute the location of the tracked object in a shorter time without losing much precision. For improving the accuracy and speeding up the training progress, we introduce the Squeeze-and-excitation (SE) network into the feature extractor. In this paper, we compare the proposed method with some state-of-the-art trackers and analysis their performances. Using our method, a siamese network could be trained with shorter time and less data. The fast processing speed enables combining object tracking with object detection or other tasks in real time.

연구 동기 및 목표

  • 특히 제한된 하드웨어 자원 환경에서 시AMESE 네트워크 기반 단일 객체 추적기의 속도와 정확도 간 상충 관계를 해결하기 위해.
  • 모델 복잡도와 학습 시간을 줄이면서도 높은 추적 정확도를 유지하기 위해.
  • 모바일 플랫폼을 포함한 저사양 장치에서 실시간 추적기 배포를 가능하게 하기 위해.
  • 성능을 훼손하지 않고도 더 적은 파라미터와 더 빠른 추론을 위한 더 단순화된 네트워크 아키텍처를 설계하기 위해.
  • 단지 5 에포크 내에 ImageNet-VID 및 GOT의 15,000개의 영상 클립만으로도 효과적으로 학습할 수 있도록 하기 위해.

제안 방법

  • 특징 추출기 내부에 Squeeze-and-Excitation (SE) 블록을 통합하여 채널 기반 특징 표현을 향상시키고 학습 속도를 증가시킨다.
  • 템플릿 영역와 검색 영역 간의 특징 매칭을 빠르게 하기 위해 커널 크기를 줄인 상관관계 레이어를 사용하여 파라미터 수를 감소시킨다.
  • 목표 바운딩 박스 좌표를 예측하기 위해 1×1 합성곱층과 완전 연결층을 차용하여 효율적인 회귀를 수행한다.
  • ImageNet-VID 및 GOT 데이터셋에서 끝내기 학습을 수행하며, 15,000개의 영상 클립과 5개의 에포크만을 사용한다.
  • 특징 추출 및 회귀 단계에서 계산 복잡도를 최소화하여 추론 속도를 최적화한다.
  • 실시간 성능를 검증하기 위해 저사양 하드웨어, 즉 GeForce 840M GPU와 i7-4510U CPU에 모델을 배포한다.

실험 결과

연구 질문

  • RQ1정확도를 희생시키지 않고도 실시간 추론을 달성할 수 있도록 시AMESE 네트워크를 단순화할 수 있는가?
  • RQ2경량 시AMESE 추적기에서 SE 블록 통합이 학습 속도 향상과 특징 표현 향상에 어떻게 기여하는가?
  • RQ3성능 경쟁력 유지 조건에서 학습 시간과 데이터 요구량을 얼마나 줄일 수 있는가?
  • RQ4표준 벤치마크인 VOT 및 OTB100에서 제안된 방법은 최신 기술 대비 속도와 정확도에서 어떻게 비교되는가?
  • RQ5일회성 평가에서 재초기화 없이도 저사양 하드웨어에서 높은 성능을 달성할 수 있는가?

주요 결과

  • 저사양 장치(i7-4510U + GeForce 840M)에서 53.05 fps를 기록하여 다른 추적기들보다 뚜렷이 빠른 성능을 보였다.
  • VOT2016에서 EAO 점수 0.19와 강건성 0.53을 기록하여 정확도는 낮지만 여러 최고 수준의 추적기들보다 강건성에서 뛰어난 성능을 보였다.
  • VOT2017에서 EAO 0.13과 강건성 0.81을 기록하여 더 도전적인 시퀀스에서도 강력한 성능을 입증하였다.
  • OTB100의 일회성 평가에서 경쟁적인 성공률과 정밀도를 기록하여 많은 전통적 및 딥러닝 기반 추적기들을 능가하였다.
  • SiamFC를 포함한 대부분의 시AMESE 네트워크보다 모델 크기가 작아 모바일 및 임베디드 장치에 배포하기에 적합하다.
  • ImageNet-VID 및 GOT의 15,000개 영상 클립만으로도 단지 5개의 에포크 내에 효과적으로 학습되어 높은 데이터 효율성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.