[논문 리뷰] ByteTrackV2: 2D and 3D Multi-Object Tracking by Associating Every Detection Box
ByteTrackV2는 운동 유사도를 활용한 계층적 데이터 연동 전략을 통해 점수에 관계없이 모든 검출 박스를 연동하는 통합적이고 비모수적 프레임워크를 제안한다. 이는 2D 및 3D 다중 객체 추적에 대해 상태 기반 성능을 달성하며, nuScenes에서 LiDAR 모달리티에서 70.1%의 AMOTA, 카메라 모달리티에서 56.4%의 AMOTA를 기록하며, 다양한 검출기 간에 우수한 일반화 성능를 보이며, 검출기 외부에 추가 학습 가능한 파rameter가 없이도 성능을 달성한다.
Multi-object tracking (MOT) aims at estimating bounding boxes and identities of objects across video frames. Detection boxes serve as the basis of both 2D and 3D MOT. The inevitable changing of detection scores leads to object missing after tracking. We propose a hierarchical data association strategy to mine the true objects in low-score detection boxes, which alleviates the problems of object missing and fragmented trajectories. The simple and generic data association strategy shows effectiveness under both 2D and 3D settings. In 3D scenarios, it is much easier for the tracker to predict object velocities in the world coordinate. We propose a complementary motion prediction strategy that incorporates the detected velocities with a Kalman filter to address the problem of abrupt motion and short-term disappearing. ByteTrackV2 leads the nuScenes 3D MOT leaderboard in both camera (56.4% AMOTA) and LiDAR (70.1% AMOTA) modalities. Furthermore, it is nonparametric and can be integrated with various detectors, making it appealing in real applications. The source code is released at https://github.com/ifzhang/ByteTrack-V2.
연구 동기 및 목표
- 다중 객체 추적에서 낮은 점수의 검출 박스를 필터링함으로써 발생하는 객체 유실 및 분할된 궤적 문제를 해결하기 위해.
- 급격한 운동 변화와 일시적 은폐 상황에서 3D 환경에서의 추적 정확도를 향상시키기 위해.
- 다양한 2D 및 3D 검출기와 호환되며 추가 학습 가능한 파rameter가 없는 통합적이고 비모수적 추적 프레임워크를 개발하기 위해.
- 검출된 속도와 칼만 필터 기반 스무딩을 융합하여 3D에서의 운동 예측 성능을 향상시켜 궤적 일관성을 높이기 위해.
제안 방법
- 고점수 검출 박스를 운동 유사도(예측된 박스와 검출된 박스 간 IoU)를 기반으로 트랙릿에 먼저 매칭하는 계층적 데이터 연동 전략을 도입하고, 동일한 기준을 사용해 낮은 점수의 검출 박스를 복구한다.
- 2D 및 3D 공간에서 트랙릿의 운동 예측을 위해 칼만 필터를 사용하여 프레임 간 일관된 상태 추정을 제공한다.
- 급격한 운동 변화와 은폐에 대응하기 위해 검출된 물체 속도와 칼만 필터 출력을 융합하는 보완적 3D 운동 예측 전략을 제안한다.
- 데이터 연동을 위해 예측된 트랙릿 위치와 검출 박스 간의 유사도 측정으로 2D 또는 3D IoU를 사용한다.
- 2D 및 3D MOT 모두에 동일한 연동 메커니즘을 적용하여 최소한의 아키텍처 변경으로 통합 프레임워크를 구현한다.
- 재학습이나 추가 파rameter가 필요 없이 어떤 검출기(예: CenterPoint, TransFusion-L)와도 원활하게 통합된다.
실험 결과
연구 질문
- RQ1검출 점수와 운동 유사도를 활용한 데이터 연동 전략이 낮은 점수의 검출 박스에서 진짜 객체를 효과적으로 복구할 수 있는가?
- RQ2검출된 속도와 칼만 필터 예측을 융합하면 3D 다중 객체 추적에서 운동 모델링 성능가 향상되는가?
- RQ3학습 가능한 파rameter가 없는 비모수적이고 검출기 독립적인 추적 프레임워크가 2D 및 3D MOT 벤치마크에서 최고 성능을 달성할 수 있는가?
- RQ4계층적 연동 전략이 은폐나 급격한 운동과 같은 복잡한 상황에서 궤적 분할과 객체 유실를 얼마나 줄일 수 있는가?
주요 결과
- ByteTrackV2는 nuScenes LiDAR 3D MOT 벤치마크에서 70.1%의 AMOTA를 기록하며 새로운 최고 성능을 달성했다.
- 카메라 모달리티에서는 56.4%의 AMOTA를 기록하며 여전히 랭킹 1위를 유지했다.
- 동일한 CenterPoint 검출 결과를 기반으로 ByteTrackV2는 Immortal보다 AMOTA 2.2%p, MOTA 2.3%p 향상되었으며, IDS는 52% 감소시켰다.
- TransFusion-L 검출 결과와 결합했을 때, 검증 세트에서 75.0%의 AMOTA를 기록하여 이전 모든 방법을 초월했다.
- 테스트 세트에서는 TransFusion-L 대비 AMOTA 1.5%p 향상되고 IDS는 45% 감소하여, 추적 알고리즘의 성능 향상이 검출 품질에 독립적임을 입증했다.
- 정성적 결과 분석에서 은폐나 급격한 운동 상황에서도 정체성 전환 현상이 발생하지 않음을 확인하여 실제 환경에서의 강건성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.