[논문 리뷰] Active Learning for Deep Visual Tracking
이 논문은 깊이 신경망 기반 시각 추적을 위한 액티브 러닝 프레임워크를 제안하며, 훈련을 위해 다양하고 대표적인 비디오 시퀀스를 선택하여 레이블링 비용을 줄이고 경쟁력 있는 추적 성능을 유지한다. 다중 프레임 협업과 최근접 이웃 식별 기법을 활용함으로써 샘플 효율성이 향상되고, 경계 상자 회귀에 Tversky 손실을 적용함으로써 제한된 훈련 예산 하에서도 최신 기술 수준의 정확도를 달성한다.
Convolutional neural networks (CNNs) have been successfully applied to the single target tracking task in recent years. Generally, training a deep CNN model requires numerous labeled training samples, and the number and quality of these samples directly affect the representational capability of the trained model. However, this approach is restrictive in practice, because manually labeling such a large number of training samples is time-consuming and prohibitively expensive. In this paper, we propose an active learning method for deep visual tracking, which selects and annotates the unlabeled samples to train the deep CNNs model. Under the guidance of active learning, the tracker based on the trained deep CNNs model can achieve competitive tracking performance while reducing the labeling cost. More specifically, to ensure the diversity of selected samples, we propose an active learning method based on multi-frame collaboration to select those training samples that should be and need to be annotated. Meanwhile, considering the representativeness of these selected samples, we adopt a nearest neighbor discrimination method based on the average nearest neighbor distance to screen isolated samples and low-quality samples. Therefore, the training samples subset selected based on our method requires only a given budget to maintain the diversity and representativeness of the entire sample set. Furthermore, we adopt a Tversky loss to improve the bounding box estimation of our tracker, which can ensure that the tracker achieves more accurate target states. Extensive experimental results confirm that our active learning-based tracker (ALT) achieves competitive tracking accuracy and speed compared with state-of-the-art trackers on the seven most challenging evaluation benchmarks.
연구 동기 및 목표
- 깊이 신경망 기반 시각 추적을 위한 대규모 훈련 데이터 레이블링의 높은 비용과 시간 소모 문제를 해결한다.
- 고정된 레이블링 예산 하에서 깊이 합성곱 신경망 모델의 표현 능력을 향상시킨다.
- 시간적 일관성과 이상치 제거를 통해 선택된 훈련 샘플의 다양성과 대표성을 확보한다.
- Tversky 손실 함수를 통한 경계 상자 추정 정확도 향상으로 추적의 강건성을 향상시킨다.
- 액티브 러닝 기반 샘플 선택이 랜덤 선택 또는 전체 데이터 훈련에 비해 더 적은 레이블링 샘플로도 경쟁 가능한 추적 성능을 달성할 수 있음을 입증한다.
제안 방법
- 비디오 시퀀스의 시간적 일관성을 활용하여 다양성을 극대화하는 다중 프레임 협업 기반 액티브 러닝 전략을 제안한다.
- 평균 최근접 이웃 거리 기반의 최근접 이웃 식별 방법을 도입하여 고립되거나 저품질의 시퀀스를 제거함으로써 선택된 서브셋의 대표성을 확보한다.
- 고정된 예산 하에서 시간적 일관성에 의한 다양성 최적화와 이상치 탐지에 의한 대표성 최적화를 동시에 고려한 샘플 선택 절차를 제안한다.
- Tversky 손실을 추적기의 경계 상자 회귀 헤드에 통합하여 가짜 양성과 가짜 음성에 대해 비대칭적으로 손실을 부여함으로써 국소화 정확도를 향상시킨다.
- 깊이 합성곱 신경망 기반 추적기(ALT)를 액티브하게 선택된 비디오 시퀀스 서브셋으로 훈련시켜 최소한의 레이블링 노력으로도 높은 성능을 달성한다.

실험 결과
연구 질문
- RQ1다중 프레임 협업 기반 액티브 러닝은 단일 프레임 또는 랜덤 선택 대비 시각 추적을 위한 선택된 훈련 시퀀스의 다양성을 향상시킬 수 있는가?
- RQ2평균 최근접 이웃 거리 기반 필터링은 저품질 또는 고립된 시퀀스를 효과적으로 제거하여 대표성을 향상시키는가?
- RQ3Tversky 손실 통합이 경계 상자 추정 및 전체 추적 정확도에 측정 가능한 향상을 이끌어내는가?
- RQ4작은 액티브 선택 훈련 서브셋으로 훈련된 추적기가 전체 데이터셋으로 훈련된 최신 기술 수준의 추적기와 비교해 경쟁 가능한 성능을 달성할 수 있는가?
- RQ5액티브 러닝은 추적 성능을 유지하거나 향상시키면서 레이블링 비용을 얼마나 줄일 수 있는가?
주요 결과
- 제안된 액티브 러닝 기반 추적기(ALT)는 일곱 개인 벤치마크 데이터셋에서 최고의 EAO 점수를 기록하며, DiMP50 및 ATOM과 같은 최신 기술 수준의 추적기들을 능가한다.
- ALT는 레이블링된 시퀀스 수가 상당히 적은 상황에서도 경쟁 가능한 추적 정확도를 달성하여 액티브 러닝 전략의 효과성을 입증한다.
- Tversky 손실의 사용은 경계 상자 추정을 향상시켜 특히 가림과 변형과 같은 어려운 상황에서 더 정확한 목표 국소화를 가능하게 한다.
- 정성적 결과에서는 ALT가 복잡한 시퀀스(예: bird1, jump, soccer)에서 SiamRPN++ 및 PrDiMP50에 비해 가림과 변형 상황에서 더 뛰어난 강건한 추적 성능을 유지함을 보여준다.
- 다중 프레임 협업과 최근접 이웃 필터링의 조합은 엄격한 예산 제약 하에서도 선택된 훈련 세트가 높은 다양성과 대표성을 유지함을 보장한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.