Skip to main content
QUICK REVIEW

[논문 리뷰] ePointDA: An End-to-End Simulation-to-Real Domain Adaptation Framework for LiDAR Point Cloud Segmentation

Sicheng Zhao, Yezhen Wang|arXiv (Cornell University)|2020. 09. 07.
Advanced Neural Network Applications참고 문헌 73인용 수 8
한 줄 요약

ePointDA는 LiDAR 포인트 클라우드 세분화를 위한 엔드 투 엔드 시뮬레이션에서 실세계로의 도메인 적응 프레임워크로, 픽셀 수준의 드롭아웃 노이즈와 특징 수준의 도메인 시프트를 해결한다. 자체 학습 기반 드롭아웃 노이즈 렌더링과 통계에 불변적이며 공간적으로 적응적인 특징 정렬을 사용하여 실세계 통계 자료가 필요 없이도 정확도를 향상시키며, KITTI 및 SemanticKITTI 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Due to its robust and precise distance measurements, LiDAR plays an important role in scene understanding for autonomous driving. Training deep neural networks (DNNs) on LiDAR data requires large-scale point-wise annotations, which are time-consuming and expensive to obtain. Instead, simulation-to-real domain adaptation (SRDA) trains a DNN using unlimited synthetic data with automatically generated labels and transfers the learned model to real scenarios. Existing SRDA methods for LiDAR point cloud segmentation mainly employ a multi-stage pipeline and focus on feature-level alignment. They require prior knowledge of real-world statistics and ignore the pixel-level dropout noise gap and the spatial feature gap between different domains. In this paper, we propose a novel end-to-end framework, named ePointDA, to address the above issues. Specifically, ePointDA consists of three modules: self-supervised dropout noise rendering, statistics-invariant and spatially-adaptive feature alignment, and transferable segmentation learning. The joint optimization enables ePointDA to bridge the domain shift at the pixel-level by explicitly rendering dropout noise for synthetic LiDAR and at the feature-level by spatially aligning the features between different domains, without requiring the real-world statistics. Extensive experiments adapting from synthetic GTA-LiDAR to real KITTI and SemanticKITTI demonstrate the superiority of ePointDA for LiDAR point cloud segmentation.

연구 동기 및 목표

  • 합성 및 실세계 LiDAR 포인트 클라우드 간의 도메인 시프트 문제를 세분화 작업에서 해결한다.
  • 기존의 다단계, 엔드 투 엔드가 아닌 SRDA 방법들이 픽셀 수준의 드롭아웃 노이즈와 공간적 특징 갭을 忽시하는 한계를 극복한다.
  • 도메인 적응에 실세계 통계 자료에 의존하지 않도록 하여 점진적인 실세계 데이터에 대한 강건성을 확보한다.
  • 엔드 투 엔드 프레임워크 내에서 픽셀 수준의 노이즈 렌더링과 특징 수준의 정렬을 함께 모델링하여 세분화 성능을 향상시킨다.
  • 합성 데이터를 사용하여 실세계 자율주행 환경에서 실용적으로 LiDAR 기반 모델을 구현할 수 있도록 한다.

제안 방법

  • 실세계 레이블이 없는 데이터를 이용해 포인트 좌표에서 드롭아웃 노이즈를 예측하는 자체 학습 기반 드롭아웃 노이즈 렌더링(SDNR) 모듈을 도입한다.
  • 도메인 간 통계에 불변적인 특징 정렬을 달성하기 위해 인스턴스 정규화와 고차 모멘트 매칭(HoMM)을 활용한다.
  • 공간적으로 적응적인 컨볼루션과 도메인에 불변적인 어텐션을 통합하여 공간적 특징을 정렬하고 공간적 특징 갭을 메운다.
  • SDNR, 특징 정렬, 세분화 헤드를 하나의 엔드 투 엔드 학습 파이프라인으로 통합한다.
  • 3D LiDAR 포인트 클라우드를 2D 이미지로 구면 투영하여 기하학적 구조를 유지하면서 효율적인 처리를 가능하게 한다.
  • 세분화, 노이즈 렌더링, 특징 정렬 목표를 포함하는 다단계 손실을 적용하여 공동 최적화를 수행한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 프레임워크는 합성 도메인과 실세계 도메인 간의 LiDAR 포인트 클라우드 세분화에서 도메인 시프트를 효과적으로 줄일 수 있는가?
  • RQ2픽셀 수준의 드롭아웃 노이즈를 명시적으로 모델링하면 도메인 적응 성능에 어떤 영향을 미치는가?
  • RQ3사전 실세계 통계 자료 없이도 통계에 불변적이며 공간적으로 적응적인 특징 정렬이 특징 수준의 도메인 갭을 어느 정도 줄일 수 있는가?
  • RQ4노이즈 렌더링과 특징 정렬을 동시에 최적화하는 것이 순차적 또는 파이프라인 기반 접근 방식보다 어떻게 다른가?
  • RQ5제안된 방법은 재학습 없이도 KITTI 및 SemanticKITTI와 같은 다양한 실세계 데이터셋에 일반화 가능한가?

주요 결과

  • ePointDA는 KITTI 데이터셋에서 평균 IoU 66.2%를 기록하여 최신 기술 수준(SOTA)인 SqueezeSegV2 방법보다 2.0%포인트 높은 성능을 달성한다.
  • 더 복잡한 SemanticKITTI 벤치마크에서는 ePointDA가 mIoU 54.1%를 기록하여 베이스라인 및 이전의 SRDA 방법들을 크게 앞서며 성능을 뛰어나게 한다.
  • 절단 분석 결과, SDNR와 ASAC(정렬된 공간적 적응형 컨볼루션)의 조합이 가장 높은 성능을 내며, 베이스라인 대비 2.0%의 mIoU 향상을 보였다.
  • 디컨볼루션 레이어 이후에 추가로 붙이는 컨볼루션 레이어 수는 성능에 영향을 미치며, 두 개의 레이어가 수신 필드를 최적화하고 가장 우수한 세분화 결과를 낳는다.
  • 시각화 결과, 렌더링된 드롭아웃 노이즈가 실세계 패턴과 매우 유사하게 나타나 자체 학습 기반 노이즈 렌더링 모듈의 효과성을 검증한다.
  • ePointDA는 보행자에 대한 오분류를 줄이고, 특히 점수 누락이 발생하는 어려운 실세계 환경에서 객체 경계 예측 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.