[논문 리뷰] TGCN: Time Domain Graph Convolutional Network for Multiple Objects Tracking
이 논문은 복수 객체 추적을 위한 시간 도메인 그래프 컨볼루션 네트워크인 TGCN을 제안한다. TGCN은 과거 프레임과 현재 프레임의 특징 간의 시간적 관계를 모델링하여 자세 특징 표현을 향상시킨다. 데이터 기반 상관관계 행렬과 GCN을 활용해 프레임 간 외관 특징을 전파함으로써, TGCN은 MOTA를 MOT16에서 1.3% 향상시키며 높은 추론 속도를 유지한다.
Multiple object tracking is to give each object an id in the video. The difficulty is how to match the predicted objects and detected objects in same frames. Matching features include appearance features, location features, etc. These features of the predicted object are basically based on some previous frames. However, few papers describe the relationship in the time domain between the previous frame features and the current frame features.In this paper, we proposed a time domain graph convolutional network for multiple objects tracking.The model is mainly divided into two parts, we first use convolutional neural network (CNN) to extract pedestrian appearance feature, which is a normal operation processing image in deep learning, then we use GCN to model some past frames' appearance feature to get the prediction appearance feature of the current frame. Due to this extension, we can get the pose features of the current frame according to the relationship between some frames in the past. Experimental evaluation shows that our extensions improve the MOTA by 1.3 on the MOT16, achieving overall competitive performance at high frame rates.
연구 동기 및 목표
- 운동의 모호성과 가림으로 인해 발생하는 정체성 전환 문제를 해결하기 위해.
- 과거 프레임의 시간적 의존성을 활용하여 예측된 객체의 외관 특징 표현을 향상시키기 위해.
- 간단한 t-1 프레임 연결을 초월하여 프레임 간 객체 특징 간 시간 도메인 관계를 모델링하기 위해.
- 새로운 그래프 기반 특징 전파 메커니즘을 사용해 학습된 시간 역학을 추적 연관 과정에 통합하기 위해.
제안 방법
- YOLOv5 기반 검출기가 각 프레임에서 객체 검출 및 외관 특징을 추출한다.
- 사전 지식 기반 단방향 연결(t-1에서 t로)과 프레임 간 유사도 확률을 사용하여 시간 도메인 그래프를 구성한다.
- 그래프 인접 행렬 A는 A = Q + P로 정의되며, Q는 시간 순서를 코딩하고 P는 학습된 특징 유사도를 코딩한다.
- 다중층 GCN이 시간 도메인 그래프를 통해 특징을 전파하며, 계층별 업데이트는 X^(l+1) = σ(AX^(l)W)로 이루어져 시간 의존성을 학습한다.
- 과거 프레임의 시간 창 C에서의 특징을 사용하여 현재 프레임의 자세 특징을 예측한다.
- 최종 연관은 히úng거리안 할당에서 운동(Mahalanobis 거리), 속도(cosine 유사도), 외관(d3) 메트릭의 가중 조합을 사용한다.
실험 결과
연구 질문
- RQ1즉각적인 과거 프레임을 초월한 시간적 관계 모델링이 복수 객체 추적에서 외관 특징 표현을 향상시키는가?
- RQ2데이터 기반 그래프 컨볼루션 네트워크가 추적에서 시간에 걸쳐 특징 전파를 어떻게 향상시키는가?
- RQ3GCN 기반 시간 모델링이 표준 칼만 필터 및 외관 전용 방법에 비해 정체성 전환을 줄이는가?
- RQ4시간 도메인 구조를 통합할 경우 추론 속도를 희생시키지 않고 추적 정확도는 어느 정도 향상되는가?
주요 결과
- TGCN은 MOT16 벤치마크에서 62.7%의 MOTA를 달성하여 기준 모델인 DeepSORT 대비 1.3% 향상되었다.
- 정체성 전환 수가 DeepSORT의 781명에서 751명으로 감소하여 추적 일관성이 향상됨을 보여주었다.
- 거짓 양성(FP)과 거짓 음성(FN)이 각각 7101과 55581으로 감소하여 검출 연관 정확도 향상을 나타냈다.
- 모델은 고속 추론을 유지하였으며, V100 GPU에서 YOLOv5가 프레임당 20ms 미만으로 처리할 수 있었다.
- 속도 및 자세 특징의 통합은 외관 전용 또는 운동 전용 기반 모델에 비해 정체성 전환을 크게 감소시켰다.
- 인접 행렬 A에 학습된 상관관계 행렬 P를 사용함으로써 단순한 시간 순서 전달을 초월한 특징 전파가 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.