Skip to main content
QUICK REVIEW

[논문 리뷰] ViP-DeepLab: Learning Visual Perception with Depth-aware Video Panoptic Segmentation

Siyuan Qiao, Yukun Zhu|arXiv (Cornell University)|2020. 12. 09.
Advanced Vision and Imaging참고 문헌 95인용 수 7
한 줄 요약

ViP-DeepLab는 시각에서의 역투영 문제를 해결하기 위해 단일 뎀프 심도 추정과 영상 파노프틱 세분화를 동시에 수행하는 통합 모델인 깊이 인식 영상 파노프틱 세분화(DVPS)를 제안한다. 이는 최신 기술 수준(SOTA)의 성능을 달성하여 KITTI 심도 추정 및 KITTI MOTS에서 1위를 기록하고, Cityscapes-VPS에서도 이전 방법보다 5.1% 높은 VPQ를 기록한다.

ABSTRACT

In this paper, we present ViP-DeepLab, a unified model attempting to tackle the long-standing and challenging inverse projection problem in vision, which we model as restoring the point clouds from perspective image sequences while providing each point with instance-level semantic interpretations. Solving this problem requires the vision models to predict the spatial location, semantic class, and temporally consistent instance label for each 3D point. ViP-DeepLab approaches it by jointly performing monocular depth estimation and video panoptic segmentation. We name this joint task as Depth-aware Video Panoptic Segmentation, and propose a new evaluation metric along with two derived datasets for it, which will be made available to the public. On the individual sub-tasks, ViP-DeepLab also achieves state-of-the-art results, outperforming previous methods by 5.1% VPQ on Cityscapes-VPS, ranking 1st on the KITTI monocular depth estimation benchmark, and 1st on KITTI MOTS pedestrian. The datasets and the evaluation codes are made publicly available.

연구 동기 및 목표

  • 2D 이미지 시퀀스로부터 의미적 및 인스턴스 수준의 일致성을 유지하는 3D 포인트 클라우드 복원을 통해 시각에서의 역투영 문제를 해결하기 위해.
  • 단일 뷰 심도 추정과 영상 파노프틱 세분화를 하나의 작업으로 통합하여 깊이 인식 영상 파노프틱 세분화(DVPS)로 명명한다.
  • 심도 및 세분화 성능을 종합적으로 측정하는 새로운 평가 지표인 깊이 인식 영상 파노프틱 품질(DVPQ)을 개발하기 위해.
  • 기존 데이터에 심도 및 3D 애너테이션을 추가하여 Cityscapes-DVPS와 SemKITTI-DVPS라는 두 가지 공개 데이터셋을 구축하기 위해.
  • 심도 추정 및 다중 객체 추적을 포함한 개별 하위 작업에서 우수한 성능을 보이는 DVPS에 대한 새로운 SOTA 기준을 수립하기 위해.

제안 방법

  • 연속된 영상 프레임 간의 중심 회귀를 수행하도록 Panoptic-DeepLab를 확장하여 오프셋 예측을 통한 시간적으로 일致하는 인스턴스 추적을 가능하게 한다.
  • 공통 백본과 심도 추정 및 파노프틱 세분화를 위한 별도 헤드를 갖춘 이중 스트림 아키텍처를 사용하며, 엔드 투 엔드로 훈련한다.
  • 정확도 향상을 위해 테스트 시 증강(다중 해상도 추론 및 수평 뒤집기)과 데이터 증강(AutoAugment)을 적용한다.
  • 특징 표현 및 시간적 일관성을 향상시키기 위해 재귀적 특징 피라미드(RFP)와 조밀한 맥락 모듈을 통합한다.
  • 추가 애너테이션이 없는 비정규화된 영상 시퀀스를 활용한 자기지도 학습을 통해 시간적 일관성을 향상시킨다.
  • KITTI MOTS에서 추적 결과를 개선하기 위해 칼만 필터 후처리를 사용하여 가림되거나 누락된 객체의 국소화 정확도를 높인다.

실험 결과

연구 질문

  • RQ1통합 딥 러닝 모델이 단일 뷰 심도 추정과 영상 파노프틱 세분화를 동시에 효과적으로 수행할 수 있는가?
  • RQ2복잡한 추적 헤드에 의존하지 않고도 영상 프레임 간 인스턴스 수준의 예측에서 시간적 일관성을 어떻게 확보할 수 있는가?
  • RQ3비정규화된 영상 시퀀스에서 자기지도 학습을 통해 DVPS 성능 향상에 미치는 영향은 어떠한가?
  • RQ4단일 모델이 심도 추정, 영상 파노프틱 세분화, 다중 객체 추적 등 여러 하위 작업에서 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ5제안된 DVPQ 지표는 심도 및 세분화 성능의 종합적 평가를 위해 기존 지표와 비교해 어떤가?

주요 결과

  • Cityscapes-VPS 벤치마크에서 ViP-DeepLab는 이전 SOTA 방법인 VPSNet보다 5.1% 높은 VPQ를 기록한다.
  • KITTI 단일 뷰 심도 추정 벤치마크에서 ViP-DeepLab는 DORN보다 SILog 기준 0.97점 높고, 행 星 규모 심도 데이터를 사용하는 MPSD를 초월한다.
  • KITTI MOTS 벤치마크에서 보행자에 대해 67.7%의 sMOTSA, 차량에 대해 80.6%의 sMOTSA를 기록하여 1위를 차지하며, PointTrack보다 각각 7.2%와 2.5% 높은 성능을 보였다.
  • 칼만 필터 후처리를 적용함으로써 보행자에 대해 sMOTSA가 1.0% 향상되고 차량에 대해 0.4% 향상되어, 가림 현상 대응 능력이 뛰어나다는 것을 입증했다.
  • 비정규화된 Cityscapes 영상에서 편재 라벨 기반 자기지도 학습을 통해 VPQ4에서 VPQ가 0.6% 향상되어 장기적인 시간적 일관성 향상 효과가 뚜렷하다는 것을 보였다.
  • ImageNet과 Cityscapes 이외의 추가 심도 학습 데이터를 사용하지 않아도 SOTA 성능을 달성하여 모델의 일반화 능력이 뛰어나다는 것을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.