Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Visual Object Tracking with Natural Language Region Proposal Network.

Qi Feng, Vitaly Ablavsky|arXiv (Cornell University)|2019. 12. 04.
Video Surveillance and Tracking Methods참고 문헌 20인용 수 13
한 줄 요약

이 논문은 자연어 기술을 통해 수동 바운딩 박스 초기화가 필요 없는 종단 간 훈련을 가능하게 하는 새로운 자연어 영역 제안 네트워크(NL-RPN)를 소개한다. 언어 및 시각적 특징을 공유 검색 브랜치를 통해 융합하고 과거 예시를 활용해 자동으로 트래커를 재설정함으로써, 가림 및 드리프트 상황에서도 강건한 트래킹 성능을 달성하며, 자연어 애너테이션을 가진 벤치마크에서 기존 방법들을 능가한다.

ABSTRACT

Tracking with natural-language (NL) specification is a powerful new paradigm to yield trackers that initialize without a manually-specified bounding box, stay on target in spite of occlusions, and auto-recover when diverged. These advantages stem in part from visual appearance and NL having distinct and complementary invariance properties. However, realizing these advantages is technically challenging: the two modalities have incompatible representations. In this paper, we present the first practical and competitive solution to the challenge of tracking with NL specification. Our first novelty is an NL region proposal network (NL-RPN) that transforms an NL description into a convolutional kernel and shares the search branch with siamese trackers; the combined network can be trained end-to-end. Secondly, we propose a novel formulation to represent the history of past visual exemplars and use those exemplars to automatically reset the tracker together with our NL-RPN. Empirical results over tracking benchmarks with NL annotations demonstrate the effectiveness of our approach.

연구 동기 및 목표

  • 수동 바운딩 박스 애너테이션 없이 자연어 기술을 활용해 시각 트래커를 초기화하는 문제를 해결하기 위해.
  • 트래킹에서 자연어 표현과 시각적 표현 간의 모odal 갭을 극복하기 위해.
  • 과거 시각적 예시 기록을 활용해 트래커 드리프트 또는 가림 상황 이후 자동으로 복구할 수 있도록 하기 위해.
  • NL-RPN과 시에이지 트래커를 결합한 종단 간 훈련 가능한 프레임워크를 개발하여 강건성을 향상시키기 위해.
  • 인간이 애너테이션한 자연어 기술을 포함한 트래킹 벤치마크에서 제안된 방법의 효과성을 입증하기 위해.

제안 방법

  • 자연어 기술을 컨volutional 커널로 변환하여 영역 제안을 생성하는 자연어 영역 제안 네트워크(NL-RPN)를 제안한다.
  • NL-RPN과 시에이지 트래커 간에 검색 브랜치를 공유하여 종단 간 훈련과 특징 정렬을 가능하게 한다.
  • 과거 시각적 예시 기록을 지도하는 새로운 표현 방식을 설계하여 자동 트래커 재설정을 유도한다.
  • NL-RPN을 시에이지 트래커와 통합하여 훈련 중에 시각적 및 언어 기반 특징을 공동 최적화한다.
  • 수동 바운딩 박스 초기화 없이 NL-RPN을 사용해 제안 영역를 생성한다.
  • 과거 프레임의 시각적 예시를 활용해 타겟 손실을 감지하고 자동 재초기화를 트리거한다.

실험 결과

연구 질문

  • RQ1자연어 기술을 사용해 수동 바운딩 박스 애너테이션 없이 시각 트래커를 효과적으로 초기화할 수 있는가?
  • RQ2자연어 표현과 시각적 표현을 어떻게 정렬하여 트래킹의 강건성을 향상시킬 수 있는가?
  • RQ3과거 시각적 예시를 활용해 트래커 드리프트 또는 가림 상황을 자동으로 감지하고 복구할 수 있는가?
  • RQ4NL-RPN과 시에이지 트래킹을 결합한 종단 간 훈련 가능한 프레임워크가 경쟁적인 성능을 달성할 수 있는가?
  • RQ5NL 애너테이션을 가진 벤치마크에서 제안된 방법이 기존 트래킹 베이스라인과 비교해 어떻게 성능을 내는가?

주요 결과

  • 제안된 NL-RPN은 오직 자연어 기술만을 사용하여 시에이지 트래커의 종단 간 훈련을 가능하게 하여 수동 초기화가 필요 없어졌다.
  • 과거 시각적 예시 기록을 활용해 자동으로 재설정함으로써, 가림 및 타겟 드리프트 상황에서도 강건한 트래킹 성능을 달성하였다.
  • NL-RPN을 시에이지 트래커와 통합함으로써, 기준 방법 대비 트래킹 정확도와 안정성이 향상되었다.
  • NL-애너테이션된 시퀀스를 포함한 트래킹 벤치마크에서 경쟁적인 성능을 보였다.
  • 다양한 시각적 및 언어적 변형에 대해 성공적으로 일반화하는 것을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.