Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Deep Representation Learning for Real-Time Tracking

Ning Wang, Wengang Zhou|arXiv (Cornell University)|2020. 07. 22.
Video Surveillance and Tracking Methods참고 문헌 76인용 수 7
한 줄 요약

이 논문은 레이블이 없는 영상만을 사용하여 완전히 새로 훈련하는 비지도 딥 표현 학습 방법을 제안한다. 전진 및 역방향 추적 경로 간의 일관성을 강제함으로써, 지도 학습이 필요 없이 강건한 특징 표현을 학습하며, 실시간 추론 속도를 유지하면서도 완전히 지도된 기준 모델과 비교할 만한 추적 정확도를 달성한다.

ABSTRACT

The advancement of visual tracking has continuously been brought by deep learning models. Typically, supervised learning is employed to train these models with expensive labeled data. In order to reduce the workload of manual annotations and learn to track arbitrary objects, we propose an unsupervised learning method for visual tracking. The motivation of our unsupervised learning is that a robust tracker should be effective in bidirectional tracking. Specifically, the tracker is able to forward localize a target object in successive frames and backtrace to its initial position in the first frame. Based on such a motivation, in the training process, we measure the consistency between forward and backward trajectories to learn a robust tracker from scratch merely using unlabeled videos. We build our framework on a Siamese correlation filter network, and propose a multi-frame validation scheme and a cost-sensitive loss to facilitate unsupervised learning. Without bells and whistles, the proposed unsupervised tracker achieves the baseline accuracy as classic fully supervised trackers while achieving a real-time speed. Furthermore, our unsupervised framework exhibits a potential in leveraging more unlabeled or weakly labeled data to further improve the tracking accuracy.

연구 동기 및 목표

  • 비용이 많이 드는 수동 레이블링이 필요 없는 시각 추적 방법을 개발하기 위해 레이블이 없는 영상 데이터를 활용한다.
  • 양방향 운동 일관성 기반 자기지도 학습을 이용해 딥 트래커를 완전히 새로 훈련한다.
  • 사전 훈련된 모델이나 레이블 데이터 없이도 완전히 지도된 트래커와 비교할 만한 실시간 성능을 달성한다.
  • 대규모 약한 레이블이 있거나 레이블이 없는 데이터를 활용한 비지도 표현 학습의 잠재력을 탐색한다.

제안 방법

  • 전진 및 역방향 추적 간의 경로 일관성 기반 자기지도 손실을 사용하여 시아모이스 상관 필터 네트워크를 훈련한다.
  • 시간적 안정성을 향상시키고 비지도 훈련 중 거짓 긍정을 줄이기 위해 다중 프레임 검증 기법을 도입한다.
  • 특히 목표물 실종 또는 가림을 고려해 일관성이 없는 역방향 추적에 대해 비용 감안 손실을 설계한다.
  • 초기 프레임에서 고 엔트로피 영역을 이용해 트래커를 초기화하여 수동 바운딩 박스 레이블링을 회피한다.
  • 훈련 중에 지도 레이블을 전혀 사용하지 않으며, 완전히 비지도 방식으로 작동한다.
  • 표준 벤치마크(OTB-2015, VOT2018)에서 평가되며, 완전히 지도된 및 최신 기술 트래커와 비교된다.

실험 결과

연구 질문

  • RQ1레이블이 없는 영상만을 사용하고 수동으로 레이블링된 바운딩 박스가 전혀 없더라도, 시각 트래커를 효과적으로 처음부터 훈련시킬 수 있는가?
  • RQ2전진 및 역방향 추적 경로 간의 일관성 강제가 강건하고 일반화 가능한 특징 표현을 이끌어내는가?
  • RQ3비지도 학습이 정확도와 속도 측면에서 완전히 지도된 방법과 비교할 수 있는 성능을 달성할 수 있는가?
  • RQ4가림, 운동 블러, 조도 변화와 같은 도전적인 시각 조건에서 제안된 방법의 성능은 어떠한가?

주요 결과

  • 제안된 비지도 트래커는 OTB-2015 벤치마크에서 SiamFC 및 CFNet와 같은 전통적인 완전히 지도된 트래커와 비교할 만한 기준 정확도를 달성한다.
  • 비지도 LUDT 트래커는 레이블 데이터 없이 OTB-2015에서 AUC 기준으로 ECO를 0.9% 뛰어넘는 성능을 보이며 최신 기술 수준을 확보한다.
  • 온라인 모델 업데이트 기능이 추가된 LUDT+ 버전은 성능을 추가로 향상시키며, ECO를 초월하는 추적 정확도를 확보한다.
  • 배경 혼잡, 부분적 가림, 운동 블러와 같은 어려운 상황에서도 강건한 성능을 보이며, 정성적 평가에서 DSST 및 SiamFC를 능가한다.
  • 절단 실험 결과, 다중 프레임 검증 및 비용 감안 손실이 훈련 안정성과 추적 정확도 향상에 크게 기여하는 것으로 확인된다.
  • 특징 시각화 및 속성 분석 결과, 비지도 특징는 분류 능력이 뛰어나 잘 일반화되지만, 조도 변화, 가림, 빠른 운동에서는 여전히 성능 격차가 존재한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.