Skip to main content
QUICK REVIEW

[논문 리뷰] TubeTK: Adopting Tubes to Track Multi-Object in a One-Step Training Model

Bo Pang, Yizhuo Li|arXiv (Cornell University)|2020. 06. 10.
Video Surveillance and Tracking Methods참고 문헌 45인용 수 10
한 줄 요약

TubeTK는 공간적 및 시간적 객체 위치와 운동 궤적을 동시에 인코딩하는 3D 경계 박스 튜브(Btubes)를 회귀하는 단일 단계, 엔드 투 엔드 다중 객체 추적 모델을 제안한다. 외부 검출기나 수작업 특징에 의존하지 않고 3D 컨볼루션 네트워크를 활용해 시공간 특징을 추출함으로써, MOT 벤치마크에서 최신 기술 수준의 성능을 달성하며, 사전 검출 결과를 사용하는 방법보다도 뛰어난 내성적 견고성과 더 적은 잘못된 부정 결과(false negatives)를 보여준다.

ABSTRACT

Multi-object tracking is a fundamental vision problem that has been studied for a long time. As deep learning brings excellent performances to object detection algorithms, Tracking by Detection (TBD) has become the mainstream tracking framework. Despite the success of TBD, this two-step method is too complicated to train in an end-to-end manner and induces many challenges as well, such as insufficient exploration of video spatial-temporal information, vulnerability when facing object occlusion, and excessive reliance on detection results. To address these challenges, we propose a concise end-to-end model TubeTK which only needs one step training by introducing the ``bounding-tube" to indicate temporal-spatial locations of objects in a short video clip. TubeTK provides a novel direction of multi-object tracking, and we demonstrate its potential to solve the above challenges without bells and whistles. We analyze the performance of TubeTK on several MOT benchmarks and provide empirical evidence to show that TubeTK has the ability to overcome occlusions to some extent without any ancillary technologies like Re-ID. Compared with other methods that adopt private detection results, our one-stage end-to-end model achieves state-of-the-art performances even if it adopts no ready-made detection results. We hope that the proposed TubeTK model can serve as a simple but strong alternative for video-based MOT task. The code and models are available at https://github.com/BoPang1996/TubeTK.

연구 동기 및 목표

  • 이중 단계 추적-검출(TBD) 프레임워크의 한계를 해결하기 위해, 검출 품질에 대한 의존도, 음영 처리에 대한 낮은 처리 능력, 분리된 시공간 특징 학습 등 문제점을 해결한다.
  • 공간적 및 시간적 정보를 더 효과적으로 통합하는 단순한 엔드 투 엔드 단일 단계 학습 프레임워크를 개발한다.
  • 추적 성능을 유지하거나 향상시키면서도, 외부 검출 모델, Re-ID, 광학 흐름, 기타 보조 특징에 대한 의존도를 제거한다.
  • 간결한 완전 컨volutional 3D CNN 모델이 보조 기능 없이도 최신 기술 수준의 성능을 달성할 수 있음을 입증한다.

제안 방법

  • 객체 궤적을 표현하기 위해 2D 공간 및 1D 시간 차원에서 총 15개의 점으로 정의된 '경계 박스 튜브'(Btubes)라는 개념을 도입하여 3D 시공간 제안을 제공한다.
  • 영상 클립에서 직접 연속된 시공간 특징을 추출하기 위해 3D CNN 백본을 활용하여 별도의 검출 및 추적 단계를 대체한다.
  • 앵커 기반 아님, FPN 기반 검출 헤드를 채택하여 Btubes를 엔드 투 엔드로 회귀함으로써 단일 순방향 전파에서 객체 궤적을 직접 예측한다.
  • 학습 가능한 파rameter가 없는 단순한 IoU 기반 후처리 단계를 통해 예측된 Btubes를 최종 추적 식별자로 연결한다.
  • Btubes에 내장된 운동 일관성을 활용하여 음영 처리 상황에서도 견고성을 향상시키며, Re-ID나 외관 모델링이 필요 없도록 한다.
  • 모든 모델을 단일 엔드 투 엔드 방식으로 학습함으로써 사전 학습된 검출기나 보조 감독이 필요 없도록 한다.

실험 결과

연구 질문

  • RQ1사전 학습된 객체 검출기 의존도 없이 단일 단계, 엔드 투 엔드 딥 러닝 모델이 다중 객체 추적에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2기존의 이중 단계 TBD 방법과 비교해, 3D 경계 박스 튜브를 회귀하는 모델이 심한 객체 음영 처리 상황을 얼마나 잘 처리할 수 있는가?
  • RQ3광학 흐름, 자세, 세그멘테이션 등 수작업 특징이 없는 3D CNN 기반 모델이 정확한 다중 객체 추적을 위해 충분한 시공간 특징을 추출할 수 있는가?
  • RQ4궤적 사전 지식으로서 Btubes를 사용함으로써 추적의 견고성은 향상되고, 음영 처리 시 잘못된 부정 결과는 감소하는가?
  • RQ5간단한 완전 컨볼루션, 단일 단계 추적자도 Re-ID나 사전 검출 결과를 사용하는 복잡한 다단계 추적자보다 성능이 뛰어나게 할 수 있는가?

주요 결과

  • TubeTK는 MOT16에서 66.9의 MOTA를 기록하여, 사전 검출 결과를 사용하는 방법조차도 초월하는 최신 기술 수준의 성능을 달성했다.
  • MOT17에서는 64.0 MOTA를 기록하여, 공개 검출 결과에 의존하는 다른 최신 기술 수준의 방법들(54.5 MOTA)을 능가하며, 보조 데이터 없이도 뛰어난 일반화 능력을 보였다.
  • 특히 시야가 50% 이하로 떨어지는 상황에서 음영 처리 시 잘못된 부정 결과(FN)를 크게 감소시켜, 객체 음영 처리에 대한 뛰어난 견고성을 입증했다.
  • 링킹 프로세스는 노이즈가 있는 Btube 예측에도 매우 견고하며, 중심 위치나 크기의 25% 이격에도 MOTA > 86를 유지하여 후처리 파이프라인의 안정성을 입증했다.
  • ID 스위치 수가 더 높음에도 불구하고 TubeTK는 경쟁 수준의 IDF1 성능 유지를 보이며, Btube 기반 운동 모델링만으로도 외관 특징 없이도 강력한 추적 성능을 달성할 수 있음을 보여주었다.
  • 절단 실험을 통해 TubeTK의 성능가 외부 검출 모델에 의존하지 않음을 확인하였으며, 공개 검출 결과만을 사용할 경우에도 검출 기반 최신 기술 수준의 방법들을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.