Skip to main content
QUICK REVIEW

[논문 리뷰] MOPT: Multi-Object Panoptic Tracking

Juana Valeria Hurtado, Rohit Mohan|arXiv (Cornell University)|2020. 04. 17.
Video Surveillance and Tracking Methods참고 문헌 28인용 수 21
한 줄 요약

이 논문은 정신적 분할, 인스턴스 분할, 다중 객체 추적를 하나의 엔드 투 엔드 프레임워크로 통합하는 통합 작업인 다중 객체 페노틱 추적(MOPT)을 소개한다. 제안된 PanopticTrackNet 아키텍처는 SemanticKITTI에서 48.23%의 sPTQ와 Virtual KITTI 2에서 50.3%의 PQ를 기록하며, 전문화된 베이스라인을 능가하면서도 거의 4배 빠른 속도를 보인다.

ABSTRACT

Comprehensive understanding of dynamic scenes is a critical prerequisite for intelligent robots to autonomously operate in their environment. Research in this domain, which encompasses diverse perception problems, has primarily been focused on addressing specific tasks individually rather than modeling the ability to understand dynamic scenes holistically. In this paper, we introduce a novel perception task denoted as multi-object panoptic tracking (MOPT), which unifies the conventionally disjoint tasks of semantic segmentation, instance segmentation, and multi-object tracking. MOPT allows for exploiting pixel-level semantic information of 'thing' and 'stuff' classes, temporal coherence, and pixel-level associations over time, for the mutual benefit of each of the individual sub-problems. To facilitate quantitative evaluations of MOPT in a unified manner, we propose the soft panoptic tracking quality (sPTQ) metric. As a first step towards addressing this task, we propose the novel PanopticTrackNet architecture that builds upon the state-of-the-art top-down panoptic segmentation network EfficientPS by adding a new tracking head to simultaneously learn all sub-tasks in an end-to-end manner. Additionally, we present several strong baselines that combine predictions from state-of-the-art panoptic segmentation and multi-object tracking models for comparison. We present extensive quantitative and qualitative evaluations of both vision-based and LiDAR-based MOPT that demonstrate encouraging results.

연구 동기 및 목표

  • 동적 환경에서 정신적 분할, 인스턴스 분할, 다중 객체 추적를 별도로 해결하는 데서 비롯하는 한계를 해결하기 위해.
  • 기존에 별개로 다뤄지던 이들을 통합된 전체적인 인식 프레임워크로 통합하여 장면 이해를 향상시키기 위해.
  • 시간적 일관성과 프레임 간 픽셀 수준의 연관성을 활용하는 확장 가능한 엔드 투 엔드 모델을 개발하기 위해.
  • MOPT 성능을 통합적으로 평가하기 위한 새로운 평가 지표인 소프트 페노틱 추적 품질(sPTQ)을 제안하기 위해.
  • 시각 및 LiDAR 모odalities에서 광범위한 실험을 통해 공동 학습의 가능성과 우수성을 입증하기 위해.

제안 방법

  • 공통 백본과 'stuff' 및 'thing' 분할 및 추적를 위한 작업별 헤드를 갖춘 단일 단계, 엔드 투 엔드 딥 러닝 모델인 PanopticTrackNet을 제안한다.
  • 인스턴스 수준의 임베딩을 학습하고 임베딩 공간에서 마스크 연관성을 통해 시간적 일관성을 강화하는 새로운 추적 헤드를 통합한다.
  • 정신적, 인스턴스, 추적 헤드의 예측을 적응적으로 융합하여 일관된 인스턴스 ID를 갖는 페노틱 출력을 생성하는 융합 모듈을 활용한다.
  • EfficientPS 상향식 페노틱 분할 프레임워크를 기반으로 하되, 공동 최적화를 위해 추적 헤드를 추가로 확장한다.
  • 마스크 예측을 위한 소프트 IoU 기반 손실과 임베딩 학습을 위한 트리플릿 유사한 손실을 사용하여 추적의 일관성을 향상시킨다.
  • sPTQ 지표를 제안하며, 이는 PQ의 확장으로서 시간에 걸쳐 잘못된 인스턴스 연관성을 페널티 처리함으로써 추적 오류를 고려한다.

실험 결과

연구 질문

  • RQ1통합 딥 러닝 모델이 하나의 엔드 투 엔드 프레임워크 안에서 정신적 분할, 인스턴스 분할, 다중 객체 추적를 효과적으로 통합할 수 있는가?
  • RQ2이러한 작업들을 공동으로 학습할 경우, 파ipelined 접근 방식에 비해 성능과 시간적 일관성이 어떻게 향상되는가?
  • RQ3시간적 일관성과 픽셀 수준의 연관성이 가림과 외형 변화 상황에서 추적의 강건성을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 sPTQ 지표가 기존 지표에 비해 MOPT 성능 평가를 더 정확하고 종합적으로 제공하는가?
  • RQ5제안된 모델은 별도의 페노틱 분할 및 다중 객체 추적 모델을 조합한 최신 베이스라인에 비해 정확도와 효율성 측면에서 어떻게 비교되는가?

주요 결과

  • PanopticTrackNet은 SemanticKITTI 데이터셋에서 48.23%의 sPTQ를 기록하여 최고 성능의 베이스라인보다 2.19% 향상되었다.
  • 모델은 최고 성능의 베이스라인 대비 거의 4배 빠른 추론 시간을 기록하여 뚜렷한 계산 효율성을 입증했다.
  • Virtual KITTI 2에서 PanopticTrackNet은 50.3%의 PQ를 기록하여 최신 기술 수준을 유지하면서도 훨씬 더 빠른 속도를 보였다.
  • 정성 평가에서 PanopticTrackNet은 가림과 재등장 상황에서도 일관된 트랙 ID를 유지하는 반면, 베이스라인은 자주 트랙을 상실하고 재할당하는 경향을 보였다.
  • 시각 및 LiDAR 모달리티 양쪽에서 PanopticTrackNet은 MOTS 지표에서 모든 베이스라인을 능가하여 뛰어난 추적 일반화 능력을 입증했다.
  • SemanticKITTI에서 'stuff' 클래스 성능은 약간 낮지만, PanopticTrackNet은 'things' 클래스에서 훨씬 높은 성능을 기록했으며, 추론 속도가 훨씬 빠르다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.