Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Visual Tracking via Hierarchical Convolutional Features

Chao Ma, Jia‐Bin Huang|arXiv (Cornell University)|2017. 07. 12.
Video Surveillance and Tracking Methods참고 문헌 62인용 수 17
한 줄 요약

이 논문은 깊이 신경망에서 유도된 계층적 합성곱 특징을 사용하여 강건한 시각 추적 방법을 제안한다. 다양한 CNN 레이어에서 적응형 상관 필터를 학습하여 거시적에서 미시적 정밀도로의 국소화를 달성하고, 척도 추정 및 재검출을 위한 장기 기억 필터를 도입함으로써 기준 데이터셋에서 최신 기술 수준의 정확도와 강건성을 달성한다. 이는 기존 추적기들보다 추적 성능과 계산 효율성 면에서 모두 뛰어나다.

ABSTRACT

In this paper, we propose to exploit the rich hierarchical features of deep convolutional neural networks to improve the accuracy and robustness of visual tracking. Deep neural networks trained on object recognition datasets consist of multiple convolutional layers. These layers encode target appearance with different levels of abstraction. For example, the outputs of the last convolutional layers encode the semantic information of targets and such representations are invariant to significant appearance variations. However, their spatial resolutions are too coarse to precisely localize the target. In contrast, features from earlier convolutional layers provide more precise localization but are less invariant to appearance changes. We interpret the hierarchical features of convolutional layers as a nonlinear counterpart of an image pyramid representation and explicitly exploit these multiple levels of abstraction to represent target objects. Specifically, we learn adaptive correlation filters on the outputs from each convolutional layer to encode the target appearance. We infer the maximum response of each layer to locate targets in a coarse-to-fine manner. To further handle the issues with scale estimation and re-detecting target objects from tracking failures caused by heavy occlusion or out-of-the-view movement, we conservatively learn another correlation filter, that maintains a long-term memory of target appearance, as a discriminative classifier. We apply the classifier to two types of object proposals: (1) proposals with a small step size and tightly around the estimated location for scale estimation; and (2) proposals with large step size and across the whole image for target re-detection. Extensive experimental results on large-scale benchmark datasets show that the proposed algorithm performs favorably against state-of-the-art tracking methods.

연구 동기 및 목표

  • 크고 변화하는 외관, 가림, 배경 혼잡성 등에 의한 시각 추적 과제 해결
  • 최종 레이어만을 사용할 경우 의미 불변성은 유지되나 공간 정밀도가 떨어지는 한계를 극복
  • 계층적 합성곱 특징에서 유도된 다중 수준의 추상화를 활용하여 강건성과 정확도 향상
  • 확장된 양성 및 부정성 예측 샘플링을 요구하지 않는 효율적인 온라인 추적 프레임워크 개발
  • 장애 발생 후 재검출을 위한 신뢰할 수 있는 척도 추정 및 재검출을 가능하게 하는 장기 기억 분류기 도입

제안 방법

  • 사전 훈련된 CNN(예: VGGNet)의 다수의 합성곱 레이어에서 유도된 특징 맵을 사용하여 다양한 추상 수준에서 대상 표현
  • 각 레이어의 특징 맵에서 선형 상관 필터를 훈련하여 반응 맵을 통해 대상 위치 예측, 거시적-미시적 국소화 가능
  • 세분화된 소프트 가중치를 통해 다수의 레이어 반응을 융합하여 의미적 강건성과 공간 정밀도 균형 조절
  • 실패 후 대상을 재검출하기 위해 분류기 기반으로 훈련된 장기 기억 상관 필터 도입
  • 두 가지 유형의 영역 제안 생성: 척도 추정을 위한 타이트 스케일 제안(작은 스텝 크기)과 재검출을 위한 넓은 제안(큰 스텝 크기)으로 EdgeBox 활용
  • 각 유형에서 가장 높은 신뢰도 제안을 최종 척도 및 재검출 추정으로 선택

실험 결과

연구 질문

  • RQ1다양한 CNN 레이어에서 유도된 계층적 특징은 유일한 최종 레이어만을 사용하는 것과 비교해 추적 정확도 및 강건성을 향상시키는가?
  • RQ2상관 필터 프레임워크 내에서 다중 수준 특징 표현을 활용해 거시적-미시적 국소화를 효과적으로 달성할 수 있는가?
  • RQ3광범위한 온라인 샘플링에 의존하지 않고도 장기 기억 분류기가 장애 발생 후 척도 추정 및 재검출을 향상시킬 수 있는가?
  • RQ4가림, 변형, 배경 혼잡성 등의 어려운 조건에서 본 방법은 어떻게 성능을 발휘하는가?
  • RQ5실시간 추적에서 최신 기술 수준의 성능을 유지하면서도 높은 효율성을 달성할 수 있는가?

주요 결과

  • 제안된 HCFT* 추적기는 VOT2015 데이터셋에서 강건성 2위, 전체 오버랩 3위를 기록하며 많은 최신 기술 추적기들을 능가한다.
  • OTB2013 및 OTB2015 벤치마크에서, 엔드 투 엔드 딥 러닝을 사용하는 기존 추적기들과 비교해도 HCFT*는 뛰어난 정확도와 강건성을 확보한다.
  • HCFT*는 6.7 FPS로 작동하여 MDNet(1.2 FPS)보다 뚜렷이 빠르며, 뛰어난 성능에도 불구하고 높은 계산 효율성을 입증한다.
  • 더 깊은 레이어에서 유도된 의미적 특징을 활용함으로써 외관 변화 및 부분적 가림에 대해 향상된 내성 강건성을 보인다.
  • 장애 사례 분석을 통해 대규모 척도 변화 및 평면 내 회전 처리에 한계가 있음을 확인하여 제안 생성 및 기하 모델링 개선 여지가 있음을 시사한다.
  • 계층적 특징 간 소프트 가중 융합을 통해 하드 가중 또는 단일 레이어 접근 방식 대비 드리프트 감소 및 국소화 정확도 향상 효과를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.