Skip to main content
QUICK REVIEW

[논문 리뷰] Recurrent Filter Learning for Visual Tracking

Tianyu Yang, Antoni B. Chan|arXiv (Cornell University)|2017. 08. 13.
Video Surveillance and Tracking Methods참고 문헌 39인용 수 10
한 줄 요약

이 논문은 온라인 미세조정 없이 실시간으로 객체별 필터를 생성하는 데 전용으로 사용되는 순환 컨볼루션 LSTM을 사용하는 새로운 시각 추적 프레임워크인 Recurrent Filter Learning(RFL)을 제안한다. 목표 예시를 순환 네트워크를 통해 처리함으로써 공간적 구조를 유지함으로써, RFL은 OTB100 및 VOT2016/2017 벤치마크에서 높은 속도와 외관 변화에 대한 강건성을 갖춘 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recently using convolutional neural networks (CNNs) has gained popularity in visual tracking, due to its robust feature representation of images. Recent methods perform online tracking by fine-tuning a pre-trained CNN model to the specific target object using stochastic gradient descent (SGD) back-propagation, which is usually time-consuming. In this paper, we propose a recurrent filter generation methods for visual tracking. We directly feed the target's image patch to a recurrent neural network (RNN) to estimate an object-specific filter for tracking. As the video sequence is a spatiotemporal data, we extend the matrix multiplications of the fully-connected layers of the RNN to a convolution operation on feature maps, which preserves the target's spatial structure and also is memory-efficient. The tracked object in the subsequent frames will be fed into the RNN to adapt the generated filters to appearance variations of the target. Note that once the off-line training process of our network is finished, there is no need to fine-tune the network for specific objects, which makes our approach more efficient than methods that use iterative fine-tuning to online learn the target. Extensive experiments conducted on widely used benchmarks, OTB and VOT, demonstrate encouraging results compared to other recent methods.

연구 동기 및 목표

  • 추론 중 SGD 기반 적응이 필요한 온라인 미세조정의 비효율성을 해결하기 위해, 이를 제거함으로써 CNN 기반 추적기의 효율성을 향상시키기.
  • 일반적인 시각 추적에서 조명 변화, 가림, 빠른 운동 등의 외관 변화에 대한 강건성을 향상시키기.
  • RNN 내 입력에 벡터화된 입력 대신 특징 맵 처리를 통해 목표 객체의 공간적 구조를 특징 인코딩 중 유지하기.
  • LSTM 메모리 유닛 내에서 완전 컨볼루션 구조를 활용하여 이동 불변 추적을 가능하게 하기.
  • 순환 필터 생성을 통해 고정밀도와 고속도를 유지하는 피드포워드, 엔드 투 엔드 학습 가능한 추적기 개발하기.

제안 방법

  • 입력, 히든, 셀, 출력 상태가 벡터가 아니라 특징 맵인 컨볼루션 LSTM을 사용하여 공간적 구조를 유지하기.
  • 예시 이미지와 검색 이미지에서 각각 특징을 추출하기 위해 공유 또는 별도의 가중치를 사용하는 별도의 인코더(E-CNN 및 S-CNN)를 사용하기.
  • LSTM 내의 완전 연결 층을 2D 컨볼루션으로 대체하여 공간적 관계를 유지하고 메모리 효율성을 향상시키기.
  • 컨볼루션 LSTM을 통해 생성된 목표 객체 전용 필터를 다음 프레임의 특징 맵과 상관 연산의 커널로 적용하기.
  • 추적 정확도 향상과 수렴 속도 향상을 위해 LSTM 메모리 상태를 전용 초기화 네트워크를 사용해 초기화하기.
  • 추론 중 온라인 적응을 피하기 위해 오프라인 사전 훈련 기간 동안 전체 네트워크를 엔드 투 엔드 방식으로 훈련하기.

실험 결과

연구 질문

  • RQ1온라인 미세조정 없이 순환 신경망이 시각 추적을 위한 객체 전용 필터를 효과적으로 생성하는 데 적합한가?
  • RQ2특징 맵을 통해 LSTM 입력에 공간적 구조를 유지함으로써, 벡터 표현 대비 추적 성능에 어떤 영향을 미치는가?
  • RQ3공간 인식 메모리 유닛을 갖춘 컨볼루션 LSTM을 사용할 경우, 외관 변화 및 운동에 대한 강건성 향상 정도는 어느 정도인가?
  • RQ4기본 벤치마크에서 정확도, 속도, 실패율 측면에서 제안된 RFL 프레임워크는 최신 기술 수준의 추적기와 비교해 어떻게 성능을 내는가?
  • RQ5E-CNN 및 S-CNN 내의 초기화 네트워크와 가중치 공유가 전체 추적 성능에 기여하는 정도는 어느 정도인가?

주요 결과

  • OTB100 벤치마크에서 RFL은 AUC 점수 0.601과 성공률 0.460을 기록하여 KCF 및 DSST를 포함한 여러 최신 기술 수준의 방법들을 능가했다.
  • VOT2016에서 RFL은 최고의 정확도 순위(1.72)와 경쟁 가능한 EAO(0.2222)를 기록했으며, 실패율 3.07로 강력한 강건성을 보였다.
  • VOT2017에서 RFL은 기본 실험에서 평균 오버랩 0.48, 비지도 실험에서 0.23를 기록했고, 실시간 속도는 15.01 fps였다.
  • 절단 실험 결과, E-CNN와 S-CNN 간의 가중치 공유가 성능을 8~10% 저하시키는 것으로 나타났으며, 초기화 네트워크와 컨볼루션 LSTM 사용이 성능 향상에 크게 기여했다.
  • 정성적 결과 분석을 통해 RFL은 빠른 운동, 시야 외부, 조명 변화가 일어나는 어려운 시퀀스에서 DSST, SiamFC, KCF보다 뛰어난 성능을 보였다.
  • OTB100의 성공도 그래프에서 RFL은 모든 여섯 가지 도전 과제 속성에서 최고 또는 유사한 성능를 기록했으며, 특히 빠른 운동과 시야 외부 상황에서 뛰어난 성능를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.