[논문 리뷰] RetinaTrack: Online Single Stage Joint Detection and Tracking
RetinaTrack는 온라인 추적을 위한 인스턴스 수준의 임베딩을 추가한 단일 단계의 간단하고 효율적인 동시 검출 및 추적 모델을 제안한다. Waymo Open Dataset에서 기존 방법보다 훨씬 낮은 추론 지연 시간을 기록하면서 최신 기술 수준의 성능을 달성하였으며, MOTA(44.92 vs. 42.62)와 mAP에서 Tracktor++를 능가하면서도 37배 빠르다.
Traditionally multi-object tracking and object detection are performed using separate systems with most prior works focusing exclusively on one of these aspects over the other. Tracking systems clearly benefit from having access to accurate detections, however and there is ample evidence in literature that detectors can benefit from tracking which, for example, can help to smooth predictions over time. In this paper we focus on the tracking-by-detection paradigm for autonomous driving where both tasks are mission critical. We propose a conceptually simple and efficient joint model of detection and tracking, called RetinaTrack, which modifies the popular single stage RetinaNet approach such that it is amenable to instance-level embedding training. We show, via evaluations on the Waymo Open Dataset, that we outperform a recent state of the art tracking algorithm while requiring significantly less computation. We believe that our simple yet effective approach can serve as a strong baseline for future work in this area.
연구 동기 및 목표
- 자율 주행에서 검출 및 추적을 별도의 시스템으로 학습하는 데서 비효율성과 복잡성을 해결하기 위해.
- 공유된 특징을 통해 검출 및 추적을 동시 학습시켜 가짜 경고와 ID 전환을 줄이며 추적 성능을 향상시키기 위해.
- 높은 정확도를 유지하면서 계산 오버헤드를 최소화해 실시간 추론을 가능하게 하기 위해.
- 향후 2D RGB 입력을 사용하는 동시 검출 및 추적 분야의 연구를 위한 강력하고 단순한 기준 모델을 확립하기 위해.
제안 방법
- 데이터 연동을 위해 FPN 이후의 예측 헤드를 수정하여 인스턴스 수준의 임베딩을 출력하도록 하여 검출 및 추적의 동시 학습을 가능하게 한다.
- 검출 손실(Focal Loss)과 인스턴스 임베딩에 대한 메트릭 학습 손실을 함께 사용해 엔드 투 엔드로 모델을 훈련시킨다.
- 프레임 간 데이터 연동을 위해 임베딩 간余弦 유사도를 사용하여 기존의 IOU 기반 추적 방식을 대체한다.
- RetinaNet의 강력한 검출 백본(ResNet-50)을 활용해 소형 객체 및 가림, 저조도와 같은 어려운 조건에서도 성능을 유지를 한다.
- 트랙릿을 유지하고 임베딩 유사도 및 공간적 근접도를 기반으로 업데이트하여 온라인 추적을 구현한다.
- 비교를 위해 경량 ReID 모델(ResNet-50 TriNet)을 사용하지만, RetinaTrack는 외부 ReID 모델에 의존하지 않도록 공동 학습을 수행한다.
실험 결과
연구 질문
- RQ1단일 단계 검출기에서 온라인 다중 객체 추적을 위한 객체 검출 및 인스턴스 수준의 임베딩을 동시에 예측할 수 있는가?
- RQ2검출 및 추적을 함께 학습시키면 별도로 학습시키는 것보다 추적 성능이 향상되는가?
- RQ3두 단계 또는 다중 모듈 추적기와 비교해 상당히 낮은 추론 지연 시간을 기록하면서도 최신 기술 수준의 추적 성능을 달성할 수 있는가?
- RQ4가림, 소형 객체 크기, 저조도와 같은 어려운 자율 주행 조건에서 공동 모델의 성능은 어떠한가?
주요 결과
- RetinaTrack는 Waymo v1.1 데이터셋에서 44.92 MOTA를 기록하여 IOU 기반 기준 모델(38.25 MOTA)과 Tracktor++(42.62 MOTA)를 모두 능가한다.
- 모델은 Waymo 데이터셋에서 45.70 mAP를 달성하여 최신 기술 수준의 검출 정확도를 보여준다.
- RetinaTrack는 프레임당 70ms로 작동하여 Tracktor++(2645ms)보다 37배 빠르며, 가짜 경고와 ID 전환을 크게 줄였다.
- 검출 및 메트릭 학습 손실을 함께 학습시키는 것이 별도로 검출 및 ReID를 학습시키는 것보다 더 나은 추적 성능을 낳는다.
- 외부 ReID 모델 없이도 IOU 전용 기준 모델보다 뛰어난 성능을 보이며, 검출과 함께 공동으로 학습된 인스턴스 임베딩이 매우 효과적임을 시사한다.
- 가림 및 저조도와 같은 어려운 조건에서도 일관된 추적 성능을 유지하며, 장기간의 사라짐 기간 동안에도 안정적인 추적을 수행한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.