Skip to main content
QUICK REVIEW

[논문 리뷰] LOPR: Latent Occupancy PRediction using Generative Models

Bernard Lange, Masha Itkina|arXiv (Cornell University)|2022. 10. 03.
Autonomous Vehicle Technology and Safety인용 수 4
한 줄 요약

LOPR는 다중 센서 데이터(라이adar, RGB 카메라, 고정밀 지도)를 기반으로 한 VAE-GAN 기반 생성 모델과 잠재 공간에서의 트랜스포머 기반 예측기로 구성된 새로운 잠재 점유 예측 프레임워크를 제안한다. 이는 표현 학습과 확률적 장면 예측을 분리함으로써 인간 수동 레이블링 없이 LiDAR, RGB 카메라, 고정밀 지도를 함께 조건부로 설정함으로써 NuScenes, Waymo Open 및 자체 구축 데이터셋에서 최신 기준 성능을 달성한다.

ABSTRACT

Environment prediction frameworks are integral for autonomous vehicles, enabling safe navigation in dynamic environments. LiDAR generated occupancy grid maps (L-OGMs) offer a robust bird's eye-view scene representation that facilitates joint scene predictions without relying on manual labeling unlike commonly used trajectory prediction frameworks. Prior approaches have optimized deterministic L-OGM prediction architectures directly in grid cell space. While these methods have achieved some degree of success in prediction, they occasionally grapple with unrealistic and incorrect predictions. We claim that the quality and realism of the forecasted occupancy grids can be enhanced with the use of generative models. We propose a framework that decouples occupancy prediction into: representation learning and stochastic prediction within the learned latent space. Our approach allows for conditioning the model on other available sensor modalities such as RGB-cameras and high definition maps. We demonstrate that our approach achieves state-of-the-art performance and is readily transferable between different robotic platforms on the real-world NuScenes, Waymo Open, and a custom dataset we collected on an experimental vehicle platform.

연구 동기 및 목표

  • 격자 기반의 결정론적 점유 예측 모델이 흐릿하고 비현실적인 출력을 생성하며 장면 수준의 확률적 특성을 모델링하지 못하는 한계를 해결한다.
  • 트랙토리 예측 프레임워크에서 수동으로 레이블링된 데이터에 의존하는 문제를 해결하기 위해 원시 센서 입력에서부터 종단 간, 자기지도 학습을 가능하게 한다.
  • 표현 학습과 작업별 예측을 분리함으로써 다양한 로봇 플랫폼 간에 강건하고 이식 가능한 장면 예측을 가능하게 한다.
  • 불확실성 모델링과 다중 모달 입력(LiDAR, RGB, 고정밀 지도)을 활용함으로써 미래 점유 격자 지도의 현실성과 정확성을 향상시킨다.

제안 방법

  • 점유 예측을 두 단계로 분해한다: (1) 다중 모달 센서 데이터(LiDAR, RGB, 고정밀 지도)를 기반으로 한 VAE-GAN 모델을 통한 표현 학습, (2) 학습된 잠재 공간에서의 확률적 예측.
  • 장면의 공간적 및 의미적 구조를 유지하면서도 분리된, 저차원의 잠재 표현을 학습하기 위해 VAE-GAN을 훈련한다.
  • 잠재 코드와 다중 모달 컨텍스트를 조건으로 삼아 트랜스포머 기반 디코더를 사용해 확률적 미래 점유 예측을 생성한다.
  • LiDAR 점유 격자, RGB 이미지, 고정밀 지도를 조건으로 설정하여 장면 이해력과 일반화 능력을 향상시킨다.
  • 비라벨링된 센서 데이터 시퀀스에 대해 자기지도 시퀀스-투-시퀀스 학습을 통해 프레임워크를 종단 간 최적화한다.
  • 재파arameterization과 변분 추론을 적용하여 확률적 예측을 통해 미분 가능 샘플링과 역전파를 가능하게 한다.

실험 결과

연구 질문

  • RQ1다중 모달 센서 데이터로부터 학습된 분리된 잠재 공간이 미래 점유 격자 예측의 현실성과 정확성 향상에 기여하는가?
  • RQ2예측과 표현 학습을 분리함으로써 종단 간 격자 기반 모델 대비 더 나은 일반화 및 이식 가능성 확보가 가능한가?
  • RQ3잠재 공간에서의 확률적 예측이 결정론적 예측 대비 장면 수준의 현실성과 불확실성 모델링 측면에서 뛰어나게 성능을 내는가?
  • RQ4RGB 및 고정밀 지도 입력이 부분 관측 및 가림 상황에서 예측 성능 향상에 얼마나 기여하는가?
  • RQ5이 프레임워크는 궁극적으로 트랙토리 예측과 같은 후속 지도 학습 작업을 위한 사전 학습 목적으로 활용될 수 있는가?

주요 결과

  • LOPR는 NuScenes, Waymo Open 및 자체 구축된 실세계 데이터셋에서 이전의 L-OGM 및 영상 예측 모델을 능가하는 최신 기준 성능을 달성한다.
  • LiDAR, RGB, 고정밀 지도를 모두 조건으로 삼은 LOPR의 확률적 버전은 NuScenes에서 3초 예측 수평선에서 0.61 mIoU를 기록하여 결정론적 기준 모델을 크게 앞서 간다.
  • LOPR는 움직이는 이동 요소를 올바르게 전파하고 복잡한 시나리오(예: 만남 차량, 이국적인 도로 형태)에서도 정적 장면의 세부 정보를 유지하는 현실적이고 다양한 예측 결과를 생성한다.
  • 프레임워크는 관측되지 않은 적이 있었던 이동 요소(예: 만남 차량)가 장면에 진입하는 것을 성공적으로 추론함으로써 강력한 일반화 능력과 불확실성 모델링 능력을 입증한다.
  • LOPR는 다양한 플랫폼 간에 뛰어난 이식 가능성을 보이며, 최소한의 재학습으로 다양한 로봇 시스템에 도입이 가능하다.
  • 정성적 결과는 LOPR가 지상 진실이 완전히 관측되지 않은 상황에서도 가림 처리 및 동적 상호작용을 고려한 현실적인 장면 변형을 생성할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.