Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Multi-Modality Multi-Object Tracking

Wenwei Zhang, Hui Zhou|arXiv (Cornell University)|2019. 09. 09.
Video Surveillance and Tracking Methods참고 문헌 49인용 수 13
한 줄 요약

이 논문은 이미지와 라이다 포인트 클라우드 특징을 새로운 융합 모듈과 인접성 추정기로 융합하여 신뢰성과 정확도를 향상시키는 센서에 종속되지 않는 엔드 투 엔드 다중 모odal 다중 객체 추적 프레임워크인 mmMOT을 제안한다. 모달리티별 특징 추출기와 교차 모달리티 연관성을 공동 최적화함으로써 KITTI 벤치마크에서 최신 기준 성능을 달성하며, MOT에서 깊이 있는 포인트 클라우드 표현을 데이터 연관에 활용한 것은 처음이다.

ABSTRACT

Multi-sensor perception is crucial to ensure the reliability and accuracy in autonomous driving system, while multi-object tracking (MOT) improves that by tracing sequential movement of dynamic objects. Most current approaches for multi-sensor multi-object tracking are either lack of reliability by tightly relying on a single input source (e.g., center camera), or not accurate enough by fusing the results from multiple sensors in post processing without fully exploiting the inherent information. In this study, we design a generic sensor-agnostic multi-modality MOT framework (mmMOT), where each modality (i.e., sensors) is capable of performing its role independently to preserve reliability, and further improving its accuracy through a novel multi-modality fusion module. Our mmMOT can be trained in an end-to-end manner, enables joint optimization for the base feature extractor of each modality and an adjacency estimator for cross modality. Our mmMOT also makes the first attempt to encode deep representation of point cloud in data association process in MOT. We conduct extensive experiments to evaluate the effectiveness of the proposed framework on the challenging KITTI benchmark and report state-of-the-art performance. Code and models are available at https://github.com/ZwwWayne/mmMOT.

연구 동기 및 목표

  • 자율주행 인식에서의 신뢰성-정확도 트레이드오프를 해결하기 위해 다중 센서, 다중 모달 추적 시스템을 설계하기 위해.
  • 기존 MOT 프레임워크에서 단일 센서 의존성의 한계를 극복하기 위해, 특히 센서 장애나 악조건에서의 성능을 향상시키기 위해.
  • 특히 깊이 있는 포인트 클라우드 표현을 데이터 연관에 통합함으로써 다중 모달 특징의 깊이 있는 융합을 통해 추적 정확도를 향상시키기 위해.
  • 특징 추출과 교차 모달 연관을 공동 최적화하는 엔드 투 엔드 학습 가능한 프레임워크를 개발하여 더 나은 일반화 능력을 확보하기 위해.
  • 보완적인 센서 모달리티를 활용하여 격리, 장거리, 낮은 조도와 같은 도전적인 조건에서도 강건성을 확보하기 위해.

제안 방법

  • 각 모달리티(카메라, 라이다, 레이더)가 독립적으로 특징을 추출하는 센서에 종속되지 않는 프레임워크를 설계하여 센서 장애 발생 시에도 신뢰성을 유지한다.
  • 다양한 센서의 특징을 융합하는 새로운 다중 모달 융합 모듈을 도입하여, 이를 인접성 추정기로 전달해 교차 모달 추적을 수행한다.
  • 모달리티별 특징 추출기와 인접행렬 추정기를 공동 최적화하는 엔드 투 엔드 학습을 적용하여 강력한 교차 모달 연관을 학습한다.
  • PointNet을 통해 라이다 포인트 클라우드에 깊이 있는 표현 학습을 적용하고, 이러한 특징을 직접 데이터 연관 과정에 활용함으로써 MOT에서 새로운 접근 방식을 제시한다.
  • 인접성 추정 모듈에서 상관 계산에 절대값 뺄셈을 사용하고, 순위 매기기에는 덧셈과 소프트맥스를 적용한다.
  • VGG-16에서 스킵 풀링을 활용해 다중 해상도 이미지 특징을 집계하고, 프루스텀 기반 포인트 클라우드 추출을 위한 RRC-Net을 사용한다.

실험 결과

연구 질문

  • RQ1단일 센서 고장 상황에서도 높은 신뢰성을 유지하면서 융합을 통해 뛰어난 정확도를 달성할 수 있는 다중 모달 MOT 프레임워크는 가능한가?
  • RQ2기존의 수작업으로 만든 또는 이미지 전용 특징에 비해, 데이터 연관 단계에서 깊이 있는 포인트 클라우드 표현을 사용하는 것이 얼마나 효과적인가?
  • RQ3특징 추출기와 인접성 추정기를 엔드 투 엔드로 공동 최적화하는 방식이 추적의 강건성과 정확도를 얼마나 향상시키는가?
  • RQ4격리, 장거리, 낮은 조도와 같은 도전적인 조건에서 융합 모듈의 성능은 어떠한가?
  • RQ5단일 모델이 단일 모달리티 설정과 다중 모달리티 설정 모두에서 경쟁 가능한 성능을 달성할 수 있는가, 특히 센서 고장 상황에서도 그러한가?

주요 결과

  • mmMOT 프레임워크는 이미지와 포인트 클라우드 모달리티만을 사용하는 온라인 설정에서도 KITTI 추적 벤치마크에서 최신 기준 성능을 달성한다.
  • 단일 모달리티 운영(예: 카메라 전용) 상황에서도 경쟁 가능한 성능을 기록하며, 다중 모달리티 설정 대비 성능 저하가 단 0.28%에 불과하다.
  • 실패 분석 결과, 융합이 고도의 격리 및 장거리 조건에서 ID 스위치를 크게 감소시켜 단일 모달리티 추적기가 자주 실패하는 상황에서 유의미한 개선을 이룬다.
  • 희박하거나 격리된 상황에서 포인트 클라우드 모달리티가 더 강건한 기여를 하지만, 작은 물체나 먼 거리에 있는 물체에서는 낮은 포인트 밀도로 인해 성능 저하가 더 심각하다.
  • 단일 모달리티 기반 모델 대비 격리 및 장거리 추적에서 더 강건하며, 융합 모듈이 도전적인 케이스에서 오류를 효과적으로 줄인다.
  • 데이터 연관 단계에서 깊이 있는 포인트 클라우드 특징을 활용하면, 특히 시각적 단서가 약하거나 모호한 경우 추적의 일관성이 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.