[논문 리뷰] Multi-target multi-camera vehicle tracking using transformer-based camera link model and spatial-temporal information
이 논문은 다중 대상 다중 카메라 차량 추적(MTMCT) 성능을 향상시키기 위해 공간-시간 필터링을 통합한 트랜스포머 기반 카메라 링크 모델을 제안한다. 시간적 및 방향성 마스크와 양방향 전이 시간 창을 활용하여 교차 카메라 연동에 대한 검색 공간을 크게 줄였으며, CityFlowV2 벤치마크에서 IDF1 점수 73.68%를 기록하여 2020년 AI City 챌린지의 모든 팀을 압도하고 2021년 상위 수준에 진입했다.
Multi-target multi-camera tracking (MTMCT) of vehicles, i.e. tracking vehicles across multiple cameras, is a crucial application for the development of smart city and intelligent traffic system. The main challenges of MTMCT of vehicles include the intra-class variability of the same vehicle and inter-class similarity between different vehicles and how to associate the same vehicle accurately across different cameras under large search space. Previous methods for MTMCT usually use hierarchical clustering of trajectories to conduct cross camera association. However, the search space can be large and does not take spatial and temporal information into consideration. In this paper, we proposed a transformer-based camera link model with spatial and temporal filtering to conduct cross camera tracking. Achieving 73.68% IDF1 on the Nvidia Cityflow V2 dataset test set, showing the effectiveness of our camera link model on multi-target multi-camera tracking.
연구 동기 및 목표
- 다중 대상 다중 카메라 차량 추적(MTMCT)에서 큰 검색 공간, 내부 클래스 변동성, 외부 클래스 유사성 문제를 해결하기 위해.
- 카메라 링크 모델에 공간적 및 시간적 제약 조건을 통합하여 교차 카메라 연동 정확도를 향상시키기 위해.
- 운동 방향과 전이 시간 창을 활용한 후보 매칭 필터링을 통해 Re-ID에서의 오분류를 줄이기 위해.
- 트랜스포머 기반 특징 추출을 활용하여 차량 재식별에서 더 구분력 있는 외관 특징을 확보하기 위해.
- 통합된 추적 프레임워크에 공간-시간 사전 지식을 통합하여 기존의 계층적 클러스터링 기반 방법을 뛰어넘기 위해.
제안 방법
- 자기주의 어텐션을 활용해 다운샘플링 없이 장거리 의존성을 포착하는 트랜스포머 기반 Re-ID 모델을 사용하여 구분력 있는 외관 특징을 추출한다.
- 차량 이동 방향과 시간 일관성에 기반해 불가능한 교차 카메라 연동을 필터링하기 위해 시간적 및 방향성 마스크를 적용한다.
- 이웃 카메라에서 차량이 나타날 수 있는 시간 창을 제한하기 위해 양방향 전이 시간 창(BTT)을 도입한다. 이는 후보 매칭 수를 줄인다.
- 카메라 링크 모델은 외관 특징 간 코사인 거리 기반으로 궤적을 연동하며, 유사도 임계값은 0.45로 설정하고, 궤적 길이 필터링은 2~2000 프레임 범위로 설정한다.
- 단일 카메라 추적(SCT)을 SORT 유사 연동 방식으로 수행하고, 외관 및 운동 신호를 활용한 후, 카메라 링크 모델에서 트랜스포머 강화 Re-ID와 공간-시간 필터링을 통합한다.
- Re-ID 학습 동안 색상 정규화, 무작위 컷, 무작위 플립 등의 데이터 증강 기법을 적용하여 강건성을 향상시킨다.
![Figure 1: The framework of the transformer-based ReID model from [ 3 ] . The BNNeck is introduced inspired by [ 11 ] .](https://ar5iv.labs.arxiv.org/html/2301.07805/assets/transreid.drawio.png)
실험 결과
연구 질문
- RQ1CNN 기반 모델에 비해 트랜스포머 기반 Re-ID 모델이 다중 카메라 차량 추적에서 외관 특징의 구분력을 향상시킬 수 있는가?
- RQ2공간-시간 필터링을 통합함으로써 MTMCT에서 교차 카메라 연동에 대한 검색 공간은 어떻게 감소하는가?
- RQ3시간적 및 방향성 마스크는 다중 카메라 차량 추적에서 IDF1 성능에 얼마나 기여하는가?
- RQ4양방향 전이 시간 창을 통해 차량 네트워크 내 이동 패턴을 모델링함으로써 연동 정확도를 추가로 향상시킬 수 있는가?
- RQ5제안된 카메라 링크 모델은 실세계 데이터셋에서 계층적 클러스터링 기반 기준 모델 대비 IDF1 및 강건성 측면에서 어떻게 비교되는가?
주요 결과
- 제안된 방법은 CityFlowV2 테스트 세트에서 IDF1 점수 73.68%를 기록하여 기준 방법(34.74% IDF1)을 크게 능가한다.
- 시간적 및 방향성 마스크(TDM)의 추가로 IDF1이 22.35%포인트 향상되어 공간-시간 필터링의 효과를 입증한다.
- 양방향 전이 시간 창(BTT) 통합으로 기준 대비 IDF1이 26.59%포인트 향상되어 최신 기술 수준에 도달했다.
- 2020년 AI City 챌린지에서 도시 규모 MTMC 차량 추적 트랙에서 모든 팀을 압도하며, IDF1 73.68%를 기록했고, 2위 팀의 45.85%보다 높았다.
- 2021년 AI City 챌린지에서 전체 4위를 기록했으며, IDF1 73.68%를 달성했고, 이는 높은 점수를 기록한 세 팀 뿐이었다.
- 제거 분석 결과, 공간-시간 필터링이 오분류 연동을 크게 감소시켜 최종 시스템에서 ID 정밀도(67.73%)와 ID 재현율(80.77%)을 향상시켰다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.