[논문 리뷰] Looking Beyond Two Frames: End-to-End Multi-Object Tracking Using Spatial and Temporal Transformers
MO3TR는 공간 및 시간 Transformer를 사용하여 객체 간 상호작용과 장기적인 운동 이력을 동시에 모델링하는 새로운 엔드 투 엔드 다중 객체 추적 프레임워크이다. 이는 명시적 데이터 연동 또는 히우리스틱이 없이도 음영, 트랙 초기화 및 종료에 대해 강건한 추적을 가능하게 한다. 장거리 시간 주의와 공간 특징 인코딩을 활용하여 MOT16, MOT17, MOT20 벤치마크에서 최신 기술 수준의 성능을 달성한다.
Tracking a time-varying indefinite number of objects in a video sequence over time remains a challenge despite recent advances in the field. Most existing approaches are not able to properly handle multi-object tracking challenges such as occlusion, in part because they ignore long-term temporal information. To address these shortcomings, we present MO3TR: a truly end-to-end Transformer-based online multi-object tracking (MOT) framework that learns to handle occlusions, track initiation and termination without the need for an explicit data association module or any heuristics. MO3TR encodes object interactions into long-term temporal embeddings using a combination of spatial and temporal Transformers, and recursively uses the information jointly with the input data to estimate the states of all tracked objects over time. The spatial attention mechanism enables our framework to learn implicit representations between all the objects and the objects to the measurements, while the temporal attention mechanism focuses on specific parts of past information, allowing our approach to resolve occlusions over multiple frames. Our experiments demonstrate the potential of this new approach, achieving results on par with or better than the current state-of-the-art on multiple MOT metrics for several popular multi-object tracking benchmarks.
연구 동기 및 목표
- 히우리스틱 기반 데이터 연동, 트랙 관리 및 이중 프레임 가정에 의존하는 기존 다중 객체 추적(MOT) 방법의 한계를 해결한다.
- 확장된 시간 이력에서 학습을 통해 장기적인 음영 대응, 트랙 초기화 및 종료 문제를 해결한다.
- 검출 또는 연동 모듈을 별도로 두지 않고 영상 스트림에서 직접 객체 상태를 예측하는 진정한 엔드 투 엔드 프레임워크를 개발한다.
- 다양한 트랙 이력 길이와 희귀 케이스(예: 트랙 초기화 및 종료)에 대한 증강 예제를 활용하여 일반화 능력과 강건성을 향상시킨다.
제안 방법
- 검출된 객체 간 상호작용과 시각적 측정치를 인코딩하기 위해 공간 Transformer를 사용하여 장면 전반에 걸친 암묵적 표현을 학습한다.
- 모든 과거 임베딩을 고려하는 시간 Transformer를 도입하여 두 프레임을 초월한 장거리 시간 모델링을 가능하게 한다.
- 객체-시간 주의 메커니즘을 사용해 이력적 맥락을 활용해 객체 임베딩을 반복적으로 개선함으로써, 음영과 종료를 구분할 수 있도록 한다.
- 과도한 피팅을 방지하고 일반화 능력을 향상시키기 위해 랜덤하게 변동된 트랙 이력 길이로 훈련한다.
- 트랙 초기화 및 종료 학습을 향상시키기 위해 가짜 음성(FN) 및 가짜 양성(FP) 증강 전략을 적용한다.
- 훈련 중에 트랙 이력을 오른쪽 정렬하여 학습을 안정화하고 가짜 양성 결과를 줄인다.

실험 결과
연구 질문
- RQ1완전히 엔드 투 엔드인 Transformer 기반 프레임워크가 온라인 다중 객체 추적에서 히우리스틱 기반 데이터 연동 및 트랙 관리의 필요성을 제거할 수 있는가?
- RQ2두 프레임을 초월한 장기적인 시간 정보를 통합할 경우 음영, 트랙 초기화 및 종료 성능에 어떤 영향을 미치는가?
- RQ3어느 정도 주의 메커니즘이 일시적인 음영과 실제 트랙 종료를 구분하는 데 학습할 수 있는가?
- RQ4변동하는 이력 길이 및 FP/FN 증강과 같은 훈련 전략이 모델의 강건성과 일반화 능력에 어떤 영향을 미치는가?
- RQ5통합된 상태 기반 추적 접근 방식이 표준 벤치마크에서 전통적인 검출 기반 추적 파ipeline을 초월할 수 있는가?
주요 결과
- MO3TR는 MOT16, MOT17, MOT20 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 모든 데이터셋에서 MOTA 및 IDF1에 일관된 향상을 보였다.
- 두 프레임을 초월한 장기적인 시간 이력은 추적 성능을 크게 향상시키며, 가짜 양성 결과를 감소시키고 MOTA 및 IDF1을 증가시켰다.
- 훈련 중에 가짜 양성 증강을 적용하면 가짜 양성 결과가 크게 감소하여 트랙 종료 학습이 향상되었다.
- 시간 주의 시각화 결과, 모델이 관련 있는 과거 프레임(멀리 떨어진 프레임 포함)에 주의를 기울이고, 존재하지 않는 임베딩(비존재)을 주의 메커니즘의 일부로 이해함을 확인할 수 있었다.
- 장거리 시간 모델링 덕분에 음영과 종료를 구분하는 능력이 향상되어 장기적인 음영이 발생하는 어려운 시퀀스에서 성능 향상이 뚜렷하게 나타났다.
- 변동하는 트랙 이력 길이로 훈련함으로써 과도한 피팅을 방지하고 일반화 능력을 향상시켰으며, 특히 비정상적인 객체 출현 및 사라짐 상황에서 유용했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.