Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Tracking Using Region Proposal Networks

Jimmy Ren, Zhiyang Yu|arXiv (Cornell University)|2017. 05. 30.
Video Surveillance and Tracking Methods참고 문헌 18인용 수 4
한 줄 요약

이 논문은 모델 앙상블 또는 특징 공학 없이 사전 훈련된 영역 제안 네트워크(RPN)의 상단 레이어 특징을 활용하는 새로운 시각 추적 방법인 RPN2T를 제안한다. 분류 정확도와 바운딩 박스 품질을 동시에 최적화하는 새로운 손실 함수를 도입함으로써, OTB50, OTB100 및 VOT2016 벤치마크에서 기존의 CNN 기반 및 수작업 특징 추적기보다 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Recent advances in visual tracking showed that deep Convolutional Neural Networks (CNN) trained for image classification can be strong feature extractors for discriminative trackers. However, due to the drastic difference between image classification and tracking, extra treatments such as model ensemble and feature engineering must be carried out to bridge the two domains. Such procedures are either time consuming or hard to generalize well across datasets. In this paper we discovered that the internal structure of Region Proposal Network (RPN)'s top layer feature can be utilized for robust visual tracking. We showed that such property has to be unleashed by a novel loss function which simultaneously considers classification accuracy and bounding box quality. Without ensemble and any extra treatment on feature maps, our proposed method achieved state-of-the-art results on several large scale benchmarks including OTB50, OTB100 and VOT2016. We will make our code publicly available.

연구 동기 및 목표

  • CNN 기반 시각 추적에서 모델 앙상블 및 수작업 특징 공학의 필요성을 제거하기 위해.
  • 사전 훈련된 RPN 상단 레이어 특징이 시각 추적을 위한 강력한 분류 표현으로 기능할 수 있는지 조사하기 위해.
  • 분류와 위치 추정을 동시에 최적화함으로써 RPN 특징의 잠재력을 극대화할 수 있는 손실 함수를 발견하기 위해.
  • 도메인 특화 적응 없이 단일 통합 모델을 사용하여 표준 벤치마크에서 최신 기술 수준 성능을 달성하기 위해.

제안 방법

  • 객체 검출을 위해 사전 훈련된 RPN의 상단 레이어 특징 맵을 추적의 백본 특징 표현으로 사용한다.
  • 분류 정확도와 바운딩 박스 회귀 품질을 동시에 최적화하여 특징을 추적 목표에 더 잘 맞추는 새로운 연합 손실 함수를 도입한다.
  • 영역 제안과 추적에 모두 동일한 RPN 기반 모델을 사용하여 다중 네트워크나 특징 융합 전략의 필요성을 피한다.
  • 추론 중 장기 및 단기 적응을 위해 이전 연구에서 제안된 표준 온라인 모델 업데이트 프로토콜(예: [20])을 적용한다.
  • 이전의 최신 기술 수준 추적기에서 사용된 VGG 기반 모델보다 훨씬 작은 경량 네트워크 아키텍처를 사용한다.
  • 추가적인 데이터 증강 또는 도메인 특화 튜닝 없이 OTB50, OTB100 및 VOT2016에서 표준 평가 프로토콜을 적용한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 RPN의 상단 레이어 특징를 추가 훈련이나 특징 공학 없이 시각 추적에 효과적으로 재사용할 수 있는가?
  • RQ2객체 검출과 시각 추적 목표 간의 불일치를 고려할 때, RPN 특징의 분류 잠재력을 극대화하기 위해 필요한 손실 함수 설계는 무엇인가?
  • RQ3RPN 특징을 사용하는 단일 통합 모델이 표준 벤치마크에서 기존의 CNN 기반 및 수작업 특징 추적기보다 뛰어난 성능을 낼 수 있는가?
  • RQ4제안된 방법은 음영, 조명 변화, 자세 변화와 같은 다양한 어려운 시나리오에서도 강건성을 유지하는가?

주요 결과

  • RPN2T는 OTB50 및 OTB100에서 최신 기술 수준 성능을 달성하여 수작업 특징 방법과 다른 CNN 기반 추적기 모두를 능가했다.
  • VOT2016에서 RPN2T는 0.335의 최고 예상 평균 오버랩(EAO) 점수를 기록하여 평가된 모든 방법 중 1위를 차지했다.
  • VOT2016에서 RPN2T는 0.54의 경쟁력 있는 정확도(ACC)와 0.87의 강건성(ROB)을 기록했으며, 더 작은 네트워크를 사용했음에도 불구하고 C-COT 및 TCNN을 초월한 EAO 성능을 보였다.
  • OTB100의 어려운 시나리오에서 RPN2T는 8개 모든 카테고리에서 뛰어난 강건성을 보이며 모든 기준선을 꾸준히 능가했다.
  • 제안된 연합 손실 함수는 필수적이었다. 이 손실 함수 없이 RPN 특징를 직접 사용한 경우 강력한 성능을 내지 못했으며, 이는 특징 잠재력을 해방하기 위해 필수적임을 입증했다.
  • GTX Titan X GPU에서 RPN2T는 약 2 FPS의 추론 속도를 기록하여, 최적화되지 않았음에도 불구하고 실용적인 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.