Skip to main content
QUICK REVIEW

[논문 리뷰] GAIA-1: A Generative World Model for Autonomous Driving

Anthony Hu, Lloyd Russell|arXiv (Cornell University)|2023. 09. 29.
Human Motion and Animation인용 수 27
한 줄 요약

GAIA-1은 세계 모델 트랜스포머와 비디오 확산 디코더를 결합하여 멀티모달 프롬프트로 현실적인 운전 시나리오를 생성하고, 미래 예측, 장면 이해, 그리고 자가 차량 행동의 미세한 제어를 가능하게 한다.

ABSTRACT

Autonomous driving promises transformative improvements to transportation, but building systems capable of safely navigating the unstructured complexity of real-world scenarios remains challenging. A critical problem lies in effectively predicting the various potential outcomes that may emerge in response to the vehicle's actions as the world evolves. To address this challenge, we introduce GAIA-1 ('Generative AI for Autonomy'), a generative world model that leverages video, text, and action inputs to generate realistic driving scenarios while offering fine-grained control over ego-vehicle behavior and scene features. Our approach casts world modeling as an unsupervised sequence modeling problem by mapping the inputs to discrete tokens, and predicting the next token in the sequence. Emerging properties from our model include learning high-level structures and scene dynamics, contextual awareness, generalization, and understanding of geometry. The power of GAIA-1's learned representation that captures expectations of future events, combined with its ability to generate realistic samples, provides new possibilities for innovation in the field of autonomy, enabling enhanced and accelerated training of autonomous driving technology.

연구 동기 및 목표

  • 다양한 조건에서 미래 운전 이벤트를 예측하기 위한 확장 가능하고 감독 없이 학습된 월드 모델을 개발한다.
  • 실제 데이터로부터 도로 장면과 동역학의 의미 있는 고수준 표현을 학습한다.
  • 액션과 언어 프롬프트를 통해 자가 차량의 행동과 장면 요소의 제어 가능한 생성을 가능하게 한다.
  • 장거리 시나리오 생성, 일반화, 3D 기하학적 이해와 같은 emergent 속성을 입증한다.

제안 방법

  • 시스템을 월드 모델과 비디오 확산 디코더로 분리하여 장면 추론과 고품질 비디오 렌더링을 분리한다.
  • 학습된 이미지 토크나이저를 통해 각 비디오 프레임을 이산 이미지 토큰으로 표현하고, 미래를 시퀀스에서 다음 토큰 예측으로 모델링한다.
  • 과거 이미지 토큰, 텍스트 토큰, 액션 토큰에 조건화된 다음 이미지 토큰을 예측하는 자기회귀 트랜스포머를 월드 모델로 사용한다.
  • 월드 모델 토큰에 condition된 고해상도 비디오 렌더링과 시간적 업샘플링을 수행할 수 있는 다중 작업 비디오 확산 디코더를 학습한다.
  • 지리적 위치와 날씨가 균형 있게 샘플링된 대규모 실제 UK 도시 주행 데이터셋에서 robust한 표현을 학습한다.
  • 멀티모달 프롬프트(비디오, 텍스트, 액션)를 통합하고 추론 시 분류기-없는 가이던스를 사용하여 생성된 미래를 텍스트 프롬프트와 일치시키다.

실험 결과

연구 질문

  • RQ1GAIA-1이 멀티모달 프롬프트에서 그럴듯한 미래 운전 시나리오를 신뢰성 있게 예측할 수 있는가?
  • RQ2학습된 토큰과 emergent 표현이 자율 주행에 관련된 고수준의 장면 구조, 기하학 및 동역학을 포착하는가?
  • RQ3하나의 맥락으로도 여러 가지 그럴듯한 미래를 생성할 수 있는가?
  • RQ4에고-차량의 동역학 및 장면 요소를 텍스트 프롬프트와 액션으로 어느 정도 제어할 수 있는가?
  • RQ5데이터 및 컴퓨트의 확장이 월드 모델의 성능과 샘플 품질에 어떤 영향을 주는가?

주요 결과

  • GAIA-1은 고수준의 구조와 장면 동역학을 학습하여 일관되고 그럴듯한 운전 시나리오를 가능하게 한다.
  • 모델은 일반화하고 창의성을 보여 훈련 인스턴스를 넘어서는 새로운 미래를 생성한다.
  • 맥락 인식과 3D 기하학의 이해를 보여 주행 중 도로가 유발하는 피치/롤 효과를 포함한다.
  • GAIA-1은 imaginations로 긴 길이의 안정적인 주행 비디오를 생성하고 동일한 맥락에서 여러 그럴듯한 미래를 생성한다.
  • 텍스트 프롬프트와 액션을 통해 자가 차량의 행동과 장면 속성에 대한 미세한 제어가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.