[논문 리뷰] Learning Feature Embeddings for Discriminant Model based Tracking
이 논문은 온라인 분류 추적을 위한 최적의 특징 임bedding을 학습하기 위해 미분 가능하고 닫힌 형태의 분류 모델 솔버(리지 회귀)를 컨볼루션 신경망에 통합한 새로운 엔드 투 엔드 딥 러닝 프레임워크 DCFST를 제안한다. 기존 상관 필터의 부정적 경계 효과를 피하고 엔드 투 엔드 학습을 가능하게 함으로써, 여섯 가지 벤치마크에서 최신 기술 수준의 정확도를 달성하면서도 실시간 속도를 초월한다.
After observing that the features used in most online discriminatively trained trackers are not optimal, in this paper, we propose a novel and effective architecture to learn optimal feature embeddings for online discriminative tracking. Our method, called DCFST, integrates the solver of a discriminant model that is differentiable and has a closed-form solution into convolutional neural networks. Then, the resulting network can be trained in an end-to-end way, obtaining optimal feature embeddings for the discriminant model-based tracker. As an instance, we apply the popular ridge regression model in this work to demonstrate the power of DCFST. Extensive experiments on six public benchmarks, OTB2015, NFS, GOT10k, TrackingNet, VOT2018, and VOT2019, show that our approach is efficient and generalizes well to class-agnostic target objects in online tracking, thus achieves state-of-the-art accuracy, while running beyond the real-time speed. Code will be made available.
연구 동기 및 목표
- 온라인 분류적으로 훈련된 추적기에서 일반적으로 사전 훈련된 ImageNet 특징에서 유도되는 최적화되지 않은 특징 임bedding을 해결하기 위해.
- KCF 및 CFNet와 같은 상관 필터 기반 추적기에서 내재된 부정적 경계 효과를 제거하기 위해 순환 샘플링을 직접적인 미분 가능한 최적화로 대체함으로써.
- 폐쇄형이고 미분 가능한 솔버를 CNN에 통합하여 특징 임bedding과 분류 모델의 엔드 투 엔드 학습을 가능하게 하기 위해.
- 추적 샘플의 전경-배경 클래스 불균형 문제로 인한 수렴 문제를 완화하기 위해 스파arsity 손실을 수정하여 일반화 능력과 수렴 성능을 향상시키기 위해.
- 높은 정확도와 실시간 효율성을 동시에 확보하는 단순하면서도 강력한 시각 추적 기반 설정을 수립하기 위해.
제안 방법
- 특징 임bedding의 엔드 투 엔드 학습을 가능하게 하기 위해, CNN 내부에 미분 가능하고 닫힌 형태의 분류 모델 솔버(리지 회귀)를 학습 가능한 레이어로 통합한다.
- 백프로파게이션 동안 고차원 리지 회귀 문제를 효율적으로 해결하기 위해 웁시의 항등식(Woodbury identity)을 적용하여 계산 효율성을 유지한다.
- 추적에서 전경-배경 샘플의 극단적인 불균형으로 인한 수렴 문제를 완화하기 위해, 딥 리그레션에서 유도된 수정된 스파arsity 손실을 적용한다.
- 학습을 위해 이미지 쌍(지원 및 쿼리)을 사용하여, 테스트 이미지에서 분류 모델 예측을 최적화하는 특징 임bedding을 학습한다.
- 지원 및 쿼리 이미지의 목표 주변에서 실제이고 조밀한 샘플링을 적용하여 분류 모델에 rich한 감독을 제공한다.
- 학습된 리지 회귀 모델을 사용하여 테스트 이미지에서 학습된 특징 임bedding을 추출하고 목표 위치를 예측함으로써 온라인 추적을 가능하게 한다.
실험 결과
연구 질문
- RQ1미분 가능하고 닫힌 형태의 분류 모델 솔버가 CNN에 효과적으로 통합되어 온라인 추적을 위한 최적의 특징 임bedding을 학습할 수 있는가?
- RQ2순환 샘플링을 직접 최적화로 대체함으로써 부정적 경계 효과가 제거되고 추적 정확도가 향상되는가?
- RQ3특징 임bed딩과 분류 모델의 엔드 투 엔드 학습이 새로운 객체 클래스에 대해 더 나은 일반화와 강건성을 이끌 수 있는가?
- RQ4수정된 스파arsity 손실이 불균형한 추적 샘플 환경에서 수렴 성능 향상과 모델 일반화에 어떻게 기여하는가?
- RQ5제안된 프레임워크는 최신 기술 수준의 성능를 달성하면서도 실시간 추론 속도를 유지할 수 있는가?
주요 결과
- OTB2015에서 DCFST-18은 평균 AUC 점수 63.4%를 기록하여 DiMP-18(61.0%)과 ATOM(58.3%)보다 각각 2.4%, 5.1% 높다.
- GOT10k에서 DCFST-18은 오버랩 임계치 0.5에서 성공률 71.6%를 기록하여 DiMP-18(67.2%)과 ATOM(63.4%)보다 각각 4.4%, 8.2% 높다.
- TrackingNet에서 DCFST-18은 평균 AUC 73.9%를 달성하여 DiMP-18(72.3%)보다 1.6% 높고 ATOM보다 3.6% 높다.
- VOT2018에서 DCFST-18과 DCFST-50은 각각 EAO 점수 0.416과 0.452를 기록하여 DiMP-18(0.410)과 DiMP-50(0.447)보다 각각 1.4%, 1.2% 높다.
- VOT2019에서 DCFST-18은 전체 및 실시간 도전 과제에서 각각 EAO 0.361과 0.317을 기록하여 ATOM보다 각각 6.9%, 7.7% 높다. 이는 더 작은 백본(ResNet-18)을 사용한 점을 감안할 때 더욱 놀랍다.
- DCFST-18은 더 깊은 백본(ResNet-50)과 더 많은 훈련 데이터를 사용하는 SiamRPN++보다 OTB2015, GOT10k, VOT2019의 세 벤치마크에서 일관되게 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.