Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Learning for Multi-Object Tracking with Transformers

Pierre-François De Plaen, Nicola Marinello|arXiv (Cornell University)|2023. 11. 14.
Video Surveillance and Tracking Methods인용 수 4
한 줄 요약

이 논문은 DETR 유사 객체 검출기들을 인스턴스 수준의 대비 학습을 통해 엔드 투 엔드 추적기로 변환하는 경량 다중 객체 추적 방법인 ContrasTR를 제안한다. 대비 손실, 개선된 프레임 샘플링 전략, 그리고 투영 헤드를 도입함으로써, BDD100K에서 이전 최고 성능 대비 +2.6 mMOTA 향상을 달성하고 MOT17에서 최고 성능 수준의 결과를 내며, 검출 품질을 유지하면서도 복잡한 아키텍처 확장 없이도 성능을 달성한다.

ABSTRACT

The DEtection TRansformer (DETR) opened new possibilities for object detection by modeling it as a translation task: converting image features into object-level representations. Previous works typically add expensive modules to DETR to perform Multi-Object Tracking (MOT), resulting in more complicated architectures. We instead show how DETR can be turned into a MOT model by employing an instance-level contrastive loss, a revised sampling strategy and a lightweight assignment method. Our training scheme learns object appearances while preserving detection capabilities and with little overhead. Its performance surpasses the previous state-of-the-art by +2.6 mMOTA on the challenging BDD100K dataset and is comparable to existing transformer-based methods on the MOT17 dataset.

연구 동기 및 목표

  • 검출기의 복잡한 구성 요소를 추가하지 않고도 DETR 기반 객체 검출기를 다중 객체 추적 모델로 효과적으로 변환할 수 있는 단순하면서도 효과적인 방법을 개발하는 것.
  • 대비 학습을 통한 분별성 있는 인스턴스 수준 임베딩 학습을 통해 여러 프레임 간 객체 재식별 성능을 향상시키는 것.
  • 추적 애너테이션을 필요로 하지 않고도 검출 전용 데이터셋에서 확장 가능한 사전 훈련을 통해 추적 성능을 향상시키는 것.
  • 통합된 객체 표현 세트를 통해 검출과 연관성 추적을 동시에 달성함으로써 아키텍처의 복잡성을 줄이는 것.
  • 비연속 프레임의 철저한 샘플링 전략이 운동 및 외관 변화에 대한 저항력을 향상시키는지 확인하는 것.

제안 방법

  • 모델이 동일한 객체(같은 객체) 쌍과 다른 객체(다른 객체) 쌍을 구분하도록 학습할 수 있도록 인스턴스 수준의 대비 손실을 적용한다.
  • 여러 비디오에서 비연속적인 프레임을 선택하여 배치 내에서 외관과 환경의 다양성을 높이는 개선된 샘플링 전략을 도입한다.
  • DETR의 객체 표현에서 추적 임베딩을 생성하기 위해 경량 피드포워드 네트워크(FFN) 투영 헤드를 도입하여 추적 기능을 검출 헤드에서 분리한다.
  • 추적 ID 없이 대비 학습을 사용하여 검출 데이터셋에서 사전 훈련을 수행함으로써 대규모 검출 데이터를 활용해 더 나은 임베딩 공간 품질을 확보한다.
  • 검출 손실과 대비 손실을 조합한 다중 작업 목적 함수를 사용하며, 대비 항목의 가중치를 학습 가능한 계수로 조정한다.
  • 추론 시에는 학습된 임베딩을 기반으로 예측값을 트랙에 할당하기 위해 이원 매칭을 사용한다.

실험 결과

연구 질문

  • RQ1DETR 기반 검출기가 아키텍처 수정을 최소화하면서 다중 객체 추적 시스템으로 효과적으로 변환될 수 있는가?
  • RQ2인스턴스 수준의 대비 학습이 복잡한 추적 환경에서 객체 재식별 성능에 어떻게 기여하는가?
  • RQ3운동, 가림, 외관 변화에 대한 저항력을 극대화하기 위해 어떤 샘플링 전략이 가장 효과적인가?
  • RQ4추적 애너테이션이 없는 검출 전용 데이터셋에서의 사전 훈련이 추적 성능 향상에 기여할 수 있는가?
  • RQ5공통된 검출 및 연관성 특징을 학습하기 위해 필수적인 구성 요소는 무엇이며, 이들이 상호작용하는 방식은 어떠한가?

주요 결과

  • ContrasTR는 과거 최고 성능 대비 도전적인 BDD100K 데이터셋에서 +2.6 mMOTA 향상을 달성하여 35.1 mMOTA를 기록했다.
  • MOT17 벤치마크에서 ContrasTR는 기존 트랜스포머 기반 방법들과 유사한 성능을 보이며 강력한 일반화 능력을 입증했다.
  • 제거 실험 결과, 대비 손실, 투영 헤드, 사전 훈련 모두가 핵심 요소임을 입증했으며, 이 중 어느 하나라도 제거하면 mHOTA가 3점 이상 감소했다.
  • 가장 높은 성능는 4개의 비디오와 10개의 프레임(각각 Nv=4, Nf=10)을 사용할 때 달성되었으며, BDD100K에서 36.2 mHOTA와 33.6 mMOTA를 기록했다.
  • 대비 손실 가중치 λ_contr = 0.5일 때 최적의 성능을 기록했으며, 검출과 추적 목적 간 균형을 잘 맞췄다.
  • 검출 데이터에서 대비 학습을 통해 사전 훈련을 수행하면 추적 데이터셋에서 미세조정할 때도 추적 지표가 향상되었으며, 강력한 전이 가능성(transferability)을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.