Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time visual tracking by deep reinforced decision making

Janghoon Choi, Junseok Kwon|arXiv (Cornell University)|2017. 02. 21.
Video Surveillance and Tracking Methods참고 문헌 46인용 수 7
한 줄 요약

이 논문은 실시간 시각 추적 방법을 제안하며, 동적 풀에서 최적의 템플릿을 선택하기 위해 딥 강화학습을 사용하여 외관 변화에 대한 내성 강도를 향상시키고 추적기 이탈을 감소시킨다. 합성 추적 에피소드에 대해 정책 기반 강화학습을 통해 정책 네트워크를 훈련시킴으로써, 43 fps의 속도를 달성하고 OTB-2015 및 OTB-2013 벤치마크에서 기준선 대비 10%의 OPE 성능 향상을 달성한다.

ABSTRACT

One of the major challenges of model-free visual tracking problem has been the difficulty originating from the unpredictable and drastic changes in the appearance of objects we target to track. Existing methods tackle this problem by updating the appearance model on-line in order to adapt to the changes in the appearance. Despite the success of these methods however, inaccurate and erroneous updates of the appearance model result in a tracker drift. In this paper, we introduce a novel real-time visual tracking algorithm based on a template selection strategy constructed by deep reinforcement learning methods. The tracking algorithm utilizes this strategy to choose the appropriate template for tracking a given frame. The template selection strategy is self-learned by utilizing a simple policy gradient method on numerous training episodes randomly generated from a tracking benchmark dataset. Our proposed reinforcement learning framework is generally applicable to other confidence map based tracking algorithms. The experiment shows that our tracking algorithm runs in real-time speed of 43 fps and the proposed policy network effectively decides the appropriate template for successful visual tracking.

연구 동기 및 목표

  • 시각 추적에서 정확한 온라인 외관 모델 업데이트가 이루어지지 않을 경우 발생하는 추적기 이탈 문제를 해결한다.
  • 온라인 학습 환경에서 외관 모델을 언제, 어떻게 업데이트할지에 대한 명시적 레이블 부족 문제를 해결한다.
  • 딥 강화학습을 활용하여 실시간 시각 추적을 위한 자가학습형, 일반화 가능한 템플릿 선택 전략을 개발한다.
  • 시아모닉 매칭 네트워크와 딥 강화학습을 통합하여 장기 추적 정확도와 내성 강도를 향상시킨다.
  • 모듈러 설계를 통해 다른 신뢰도 맵 기반 추적 알고리즘에 적용 가능하도록 한다.

제안 방법

  • 에이전트가 상태 표현 기반으로 풀에서 최적의 템플릿을 선택하는 순차적 결정 문제로 시각 추적을 공식화한다.
  • 공유된 컨볼루션 계층을 가진 시아모닉 매칭 네트워크를 사용하여 특징을 추출하고 현재 프레임와 템플릿 간의 유사도 점수를 계산한다.
  • VOT-2015 벤치마크 데이터셋에서 무작위로 생성된 추적 에피소드에 대해 정책 기반 강화학습을 통해 정책 네트워크를 훈련시킨다.
  • 훈련의 안정성과 샘플 효율성을 향상시키기 위해 경험 재생 메모리를 활용한다.
  • 행동 확률을 생성하기 전에 예측 점수 맵을 처리하기 위해 컨볼루션 계층을 사용해 상태를 추상화한다.
  • 정책 네트워크에서 얻은 정규화된 점수를 사용해 각 프레임에서 국소화에 가장 높은 신뢰도를 가진 템플릿을 선택한다.

실험 결과

연구 질문

  • RQ1딥 강화학습이 시각 추적에서 추적기 이탈을 감소시키는 데 효과적으로 템플릿 선택 정책을 학습할 수 있는가?
  • RQ2정책 기반 강화학습으로 훈련된 정책 네트워크는 장기 추적에서 히우리스틱 또는 최대우도 템플릿 선택 방식보다 어떻게 비교되는가?
  • RQ3제안된 방법이 차폐, 조명 변화, 스케일 변화와 같은 도전적인 속성에서 성능 향상에 어느 정도 기여하는가?
  • RQ4노이즈가 많거나 모호한 샘플에 과적합되지 않으면서 높은 성능을 유지하기 위한 최적의 업데이트 간격은 무엇인가?
  • RQ5강화학습 기반 템플릿 선택 전략은 다른 신뢰도 맵 기반 추적 프레임워크로 일반화될 수 있는가?

주요 결과

  • 제안된 추적기는 43 fps의 실시간 성능을 달성하여 실질적 구현에 적합하다.
  • OTB-2013 및 OTB-2015 벤치마크에서 기준선 방법 대비 OPE(전반적 정밀도 평가)에서 10%의 성능 향상을 기록한다.
  • 차폐, 조명 변화, 스케일 변화를 포함한 여덟 가지 도전적 속성에서 경쟁력 있는 성능을 보인다.
  • 흐림, 농구, 판다와 같은 장기 시퀀스에서 성능 향상이 가장 두드러지며, 이는 적절한 템플릿 선택이 이탈을 완화시킴을 시사한다.
  • 업데이트 간격을 줄이면 성능이 약간 향상되지만, 너무 증가시키면 성능 저하가 발생함으로써 최적의 업데이트 빈도가 존재함을 시사한다.
  • 정책 네트워크는 모호하거나 높은 불확실성 예측을 피하고, 낮은 불확실성과 신뢰도가 높은 템플릿을 선호하는 것으로 확인되었으며, 정성적 분석을 통해 이를 뒷받iesen한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.