Skip to main content
QUICK REVIEW

[논문 리뷰] RPT: Learning Point Set Representation for Siamese Visual Tracking

Ziang Ma, Linyuan Wang|arXiv (Cornell University)|2020. 08. 08.
Video Surveillance and Tracking Methods참고 문헌 36인용 수 14
한 줄 요약

이 논문은 표준 경계 상자 표현 방식을 대체하여 학습 가능한 대표 점 집합을 도입함으로써 보다 정밀한 목표물 국소화를 가능하게 하는 시아모이스 시각 추적 프레임워크인 RPT를 제안한다. 다수의 수준에서의 특징 융합과 온라인 분류 브랜치를 활용하여 RPT는 OTB2015, VOT2018, VOT2019, GOT-10k에서 최신 기술 수준의 성능을 달성하였으며, 추론 속도가 20 FPS 이상이다.

ABSTRACT

While remarkable progress has been made in robust visual tracking, accurate target state estimation still remains a highly challenging problem. In this paper, we argue that this issue is closely related to the prevalent bounding box representation, which provides only a coarse spatial extent of object. Thus an effcient visual tracking framework is proposed to accurately estimate the target state with a finer representation as a set of representative points. The point set is trained to indicate the semantically and geometrically significant positions of target region, enabling more fine-grained localization and modeling of object appearance. We further propose a multi-level aggregation strategy to obtain detailed structure information by fusing hierarchical convolution layers. Extensive experiments on several challenging benchmarks including OTB2015, VOT2018, VOT2019 and GOT-10k demonstrate that our method achieves new state-of-the-art performance while running at over 20 FPS.

연구 동기 및 목표

  • 목표물의 공간적 범위를 제공하기만 하고 기하학적 세부 정보가 부족한 경계 상자 표현 방식의 한계를 해결한다.
  • 대상 객체를 의미적이고 기하학적으로 중요한 대표 점의 집합으로 모델링하여 목표물 상태 추정 정확도를 향상시킨다.
  • 온라인으로 훈련된 분류 브랜치를 통해 간섭 요소와 외관 변화에 대한 강건성을 향상시킨다.
  • 다중 수준 융합 전략을 사용하여 계층적 컨볼루션 특징을 융합함으로써 세밀한 국소화를 가능하게 한다.
  • 다양한 벤치마크에서 최신 기술 수준의 성능를 달성하면서도 실시간 추론 속도(>20 FPS)를 유지한다.

제안 방법

  • 표준 경계 상자 대신 목표물의 공간적 범위와 핵심 기하학적 위치를 인코딩하기 위해 학습 가능한 점 집합 표현을 제안한다.
  • 오프라인으로 학습된 점 집합 예측을 위한 하나의 브랜치와 온라인으로 분류 가능한 특징 학습을 위한 다른 하나의 브랜치를 갖춘 시아모이스 네트워크를 설계한다.
  • 다양한 컨볼루션 레이어에서의 특징을 융합하여 세부적인 기하학적 정보를 캡처하는 다수 수준 융합 전략을 구현한다.
  • 기본점에서 대표 목표물 위치로의 상대적 오프셋을 예측하도록 점 집합 헤드를 훈련시켜 사전에 설정된 앵커 박스 없이 정밀한 국소화를 가능하게 한다.
  • 학습 가능한 임bedding 공간을 사용하여 점 집합을 표현함으로써 표준 역전파를 통한 엔드 투 엔드 훈련을 가능하게 한다.
  • 점 집합 예측을 세그멘테이션 헤드(D3S 적응 방식을 통해)와 융합하여 VOT2020에서 마스크 애너테이션을 기반으로 평가한다.

실험 결과

연구 질문

  • RQ1경계 상자 회귀 방식과 비교해 학습 가능한 점 집합 표현 방식이 시아모이스 시각 추적에서 목표물 상태 추정 정확도를 향상시키는가?
  • RQ2다수 수준의 특징 융합 전략이 시각 추적에서 국소화 정밀도와 기하학적 모델링을 어떻게 향상시키는가?
  • RQ3앵커 기반의 회귀 방식을 점 집합 표현 방식으로 대체함으로써 외관 및 기하학적 변화에 대한 일반화 능력과 강건성이 향상되는가?
  • RQ4온라인 분류 브랜치가 복잡한 추적 환경에서 분류 능력을 얼마나 향상시키는가?
  • RQ5제안된 방법이 표준 벤치마크에서 최신 기술 수준의 성능를 달성하면서도 실시간 추론 속도(>20 FPS)를 유지할 수 있는가?

주요 결과

  • RPT는 OTB2015에서 기준 모델인 SiamFC++(ResNet-50 기반)보다 4.0% 높은 AUC 점수 0.715를 기록하여 새로운 최신 기술 수준의 성능를 달성하였다(0.675 → 0.715).
  • VOT2018에서 RPT는 가장 높은 강건성(R=0.103)과 EAO(0.510)를 기록하여 DRNet 및 D3S를 모두 앞섰다.
  • VOT2019에서 RPT는 EAO 0.417과 정확도 0.623을 기록하여 DRNet(EAO: 0.395) 및 다른 최신 기술 수준의 방법들을 능가하였다.
  • 제거 실험 결과, 점 집합 표현, 온라인 분류, 다수 수준 융합 각각의 구성 요소가 성능 향상에 점진적으로 기여하였으며, 점 집합 표현만으로도 AUC 점수에 2.5% 향상 기여를 확인하였다.
  • 마스크 애너테이션 평가를 위한 VOT2020에서, 향상된 RPT 프레임워크는 EAO 0.539를 기록하여 새로운 프로토콜 하에서도 뛰어난 성능를 보였다.
  • 모든 벤치마크에서 20 FPS 이상의 속도로 실행되어 실시간 추론 능력이 확보되었으며, 정확도를 희생시키지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.