Skip to main content
QUICK REVIEW

[논문 리뷰] SegNet4D: Efficient Instance-Aware 4D Semantic Segmentation for LiDAR Point Cloud

Neng Wang, Ruibin Guo|arXiv (Cornell University)|2024. 06. 24.
Advanced Neural Network Applications인용 수 4
한 줄 요약

SegNet4D는 4D LiDAR 세분화에서 실시간, 인스턴스 인식 기반의 프레임워크를 제안하며, 다중 스캔 세분화를 단일 스캔 세분화와 이동 객체 세분화(MOS)로 분해하고, 투영 기반 운동 특징 인코딩과 새로운 운동-세분화 융합 모듈을 사용한다. 이는 SemantickITTI와 nuScenes에서 최고 성능을 기록하며 67.1ms의 런타임을 확보하여 이 작업 분야에서 최초로 실시간 성능을 달성한다.

ABSTRACT

4D LiDAR semantic segmentation, also referred to as multi-scan semantic segmentation, plays a crucial role in enhancing the environmental understanding capabilities of autonomous vehicles or robots. It classifies the semantic category of each LiDAR measurement point and detects whether it is dynamic, a critical ability for tasks like obstacle avoidance and autonomous navigation. Existing approaches often rely on computationally heavy 4D convolutions or recursive networks, which result in poor real-time performance, making them unsuitable for online robotics and autonomous driving applications. In this paper, we introduce SegNet4D, a novel real-time 4D semantic segmentation network offering both efficiency and strong semantic understanding. SegNet4D addresses 4D segmentation as two tasks: single-scan semantic segmentation and moving object segmentation, each tackled by a separate network head. Both results are combined in a motion-semantic fusion module to achieve comprehensive 4D segmentation. Additionally, instance information is extracted from the current scan and exploited for instance-wise segmentation consistency. Our approach surpasses state-of-the-art in both multi-scan semantic segmentation and moving object segmentation while offering greater efficiency, enabling real-time operation. Besides, its effectiveness and efficiency have also been validated on a real-world unmanned ground platform. Our code will be released at https://github.com/nubot-nudt/SegNet4D.

연구 동기 및 목표

  • 기존 4D LiDAR 세분화 방법이 계산 비용이 큰 4D 컨볼루션에 의존함에 따라 실시간 성능가 부족한 문제를 해결하기 위해.
  • 예측 파이프라인에 인스턴스 수준의 세분화 정보를 통합하여 이동 객체 세분화 정확도를 향상시키기 위해.
  • 단일 스캔 세분화와 MOS로 작업을 분리한 후 운동-세분화 융합을 수행함으로써 다중 스캔 세분화 성능을 향상시키기 위해.
  • 4D 컨볼루션 대신 투영 기반 잔차 접근 방식을 사용하여 효율적인 운동 특징 추출을 실현하기 위해.
  • 운동과 세분화 예측을 명시적으로 통합하여 세분화 정확도를 향상시키는 새로운 운동-세분화 융합 모듈을 설계하기 위해.

제안 방법

  • 프레임워크는 4D 세분화를 두 가지 별도 작업으로 간주한다: 단일 스캔 세분화와 이동 객체 세분화(MOS), 각각 전용 헤드로 처리된다.
  • 운동 특징는 연속 스캔 간 Bird's Eye View(BEV) 잔차 계산을 통해 추출되며, 4D 컨볼루션 대비 계산 비용을 크게 감소시킨다.
  • 현재 스캔에서 인스턴스 수준의 특징을 추출하고 네트워크에 융합하여 인스턴스 인식 세분화를 가능하게 한다.
  • 새로운 운동-세분화 융합 모듈(MSFM)은 점별 세분화 예측과 운동 상태를 통합하여 다중 스캔 세분화를 안내한다.
  • 이중 헤드 아키텍처와 정밀 조정을 사용하여 이동 객체 예측의 정확도를 향상시키며, 반복적 정밀 조정을 통해 성능을 개선한다.
  • 프레임워크는 SemantickITTI와 nuScenes에서 훈련 및 평가되며, 구성 요소의 기여도를 검증하기 위한 추론 분석이 수행된다.

실험 결과

연구 질문

  • RQ14D 세분화를 단일 스캔 세분화와 MOS로 분해하는 것이 종단 간 엔드 투 엔드 접근 방식에 비해 성능 향상에 기여하는가?
  • RQ2투영 기반 BEV 잔차 방법이 4D 컨볼루션 대비 낮은 계산 비용으로 운동 특징을 효과적으로 추출할 수 있는가?
  • RQ3MOS 및 세분화 파이프라인에 인스턴스 수준 정보를 통합하면 탐지 정확도가 향상되는가?
  • RQ4전용 운동-세분화 융합 모듈이 세분화 및 운동 예측을 수동으로 융합하는 것보다 성능이 뛰어나게 되는가?
  • RQ5실시간 추론을 유지하면서 최고 수준의 4D 세분화 성능을 달성할 수 있는가?

주요 결과

  • SegNet4D는 SemantickITTI 벤치마크에서 다중 스캔 세분화 mIoU 69.0과 MOS mIoU 57.5로 최고 성능을 기록한다.
  • 단일 NVIDIA RTX 3090 GPU에서 런타임이 67.1ms로, 이는 모든 이전 방법을 능가하며, 이는 이 작업 분야에서 최초로 실시간 4D 세분화 접근 방식이다.
  • 추론 분석 결과, 인스턴스 정보 통합이 MOS 및 세분화 정확도를 향상시켜 인스턴스 인식 설계의 유용성을 입증한다.
  • 단일 헤드 예측 대비 별도의 세분화 및 운동 헤드를 갖춘 이중 헤드 아키텍처가 성능이 뛰어나, 작업 분해의 이점을 입증한다.
  • 운동-세분화 융합 모듈(MSFM)은 20개의 안정화된 모델에서 수동 융합을 항상 능가하며, 운동과 세분화 예측을 융합하는 데 효과적임을 입증한다.
  • 이동 객체 예측의 정밀 조정이 MOS 및 최종 다중 스캔 세분화 성능을 향상시켜 반복적 정밀 조정의 가치를 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.