Skip to main content
QUICK REVIEW

[논문 리뷰] DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving

Xiaofeng Wang, Zheng Zhu|arXiv (Cornell University)|2023. 09. 18.
Autonomous Vehicle Technology and Safety인용 수 15
한 줄 요약

DriveDreamer는 실세계 구동 디퓨전 기반의 세계 모델을 구축하여 자율주행 영상 생성을 제어 가능하게 하고, 구조화된 교통 정보를 바탕으로 두 단계 학습하여 미래 주행 정책 예측을 가능하게 하며, nuScenes에서 향상된 영상 품질과 오픈 루프 주행 계획을 시현합니다.

ABSTRACT

World models, especially in autonomous driving, are trending and drawing extensive attention due to their capacity for comprehending driving environments. The established world model holds immense potential for the generation of high-quality driving videos, and driving policies for safe maneuvering. However, a critical limitation in relevant research lies in its predominant focus on gaming environments or simulated settings, thereby lacking the representation of real-world driving scenarios. Therefore, we introduce DriveDreamer, a pioneering world model entirely derived from real-world driving scenarios. Regarding that modeling the world in intricate driving scenes entails an overwhelming search space, we propose harnessing the powerful diffusion model to construct a comprehensive representation of the complex environment. Furthermore, we introduce a two-stage training pipeline. In the initial phase, DriveDreamer acquires a deep understanding of structured traffic constraints, while the subsequent stage equips it with the ability to anticipate future states. The proposed DriveDreamer is the first world model established from real-world driving scenarios. We instantiate DriveDreamer on the challenging nuScenes benchmark, and extensive experiments verify that DriveDreamer empowers precise, controllable video generation that faithfully captures the structural constraints of real-world traffic scenarios. Additionally, DriveDreamer enables the generation of realistic and reasonable driving policies, opening avenues for interaction and practical applications.

연구 동기 및 목표

  • 실제 주행으로부터 도출된 월드 모델의 필요성을 시뮬레이션 환경이 아닌 실제 주행에서 동기화해 제시한다.
  • 교통 구조를 효율적으로 샘플링하기 위해 HDMap, 3D 박스, 텍스트 프롬프트를 조건으로 하는 확산 기반 Autonomous-driving Diffusion Model (Auto-DM)을 도입한다.
  • 구조적 제약을 먼저 학습하고 이후 예측 비디오 및 행동 모델링을 수행하는 두 단계 학습 파이프라인을 제안한다.
  • 교통 제약 및 텍스트 프롬프트에 맞춘 컨트롤 가능한 운전 비디오 생성을 가능하게 한다.
  • DriveDreamer의 활용이 nuScenes에서 인지 학습 및 오픈 루프 주행 계획을 개선하는 데 도움이 됨을 입증한다.

제안 방법

  • HDMap, 3D 박스, 텍스트 프롬프트에 조건을 두고 운전 비디오를 생성하는 확산 기반 모델 Auto-DM을 도입한다.
  • 프레임 일관성을 보장하기 위해 공간적으로 정렬된 (HDMap) 조건과 위치 조건(3D 박스)을 게이트드 자기 주의와 시간적 주의와 결합한다.
  • 스타일 속성(날씨, 시간대 등)을 형성하는 텍스트 프롬프트를 결합하기 위해 교차 주의를 사용한다.
  • 두 단계 학습: 1단계는 단일 프레임에서 교통 구조 제약을 학습하고 이후 비디오를 학습한다; 2단계는 ActionFormer과 함께 비디오 예측 세계 모델을 학습하여 주행 행동으로부터 미래 교통 구조를 예측한다.
  • ActionFormer은 과거 행동으로부터 미래 교통 구조를 반복적으로 예측하여 Auto-DM이 미래 운전 비디오와 미래 운전 행동을 생성하도록 한다.
  • 모델 목표는 비디오 예측 항 및 행동 예측 항을 변분 바닥 하한으로 결합하고, 비디오에 대해서는 MSE, 행동에 대해서는 L1로 최적화한다.

실험 결과

연구 질문

  • RQ1확실한 구조화된 교통 정보(HdMaps, 3D 박스)를 이해하고 활용하여 현실 주행 비디오를 생성할 수 있는 확산 기반 월드 모델이 가능할까?
  • RQ2두 단계 학습 파이프라인이 실제 주행 월드 모델 학습에서 샘플링 효율성과 수렴을 개선할 수 있을까?
  • RQ3ActionFormer를 통한 운전 행동의 통합이 실제 세계 시나리오에 맞춰 정확한 미래 상태 예측과 타당한 주행 정책에 기여할 수 있을까?
  • RQ4 DriveDreamer로 생성한 합성 데이터가 nuScenes와 같은 실제 데이터셋에서 다운스트림 인지 학습과 오픈 루프 계획을 향상시킬 수 있을까?

주요 결과

  • DriveDreamer는 구조화된 교통 제약을 준수하는 컨트롤 가능한 운전 비디오 생성을 가능하게 하며, 텍스트 프롬프트로 날씨/시간대를 안내할 수 있다.
  • 교통 구조를 갖춘 1단계 Auto-DM 학습은 비디오 생성 품질과 샘플링 효율을 향상시키고, 두 번째 단계의 비전-행동 학습은 예측적인 운전 비디오와 행동을 제공한다.
  • ActionFormer는 운전 행동으로부터 미래의 교통 구조를 업데이트하여 잠재 상태를 예측하고 비디오의 사실성 및 정책의 타당성을 높인다.
  • DriveDreamer가 생성한 합성 데이터는 nuScenes에서 3D 물체 검출 지표(FCOS3D 및 BEVFusion)를 최대 3.0 mAP 및 1.9 NDS 향상시키는 효과를 보인다.
  • 오픈 루프 계획 평가에서 DriveDreamer는 이전 다중 모달 방법에 비해 L2 궤적 오차가 경쟁력 있게 작고 충돌률이 낮은 편이다.
  • 정량적 비교에서 전체 파이프라인(Auto-DM + ActionFormer)을 갖춘 DriveDreamer가 ablation 및 DriveGAN보다 더 나은 FID(14.9)와 FVD(340.8)를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.