Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Driving Scenes with Diffusion

Ethan Pronovost, Kai Wang|arXiv (Cornell University)|2023. 05. 29.
Computer Graphics and Visualization Techniques인용 수 4
한 줄 요약

이 논문은 구조적이고 물리적으로 타당한 방향성 있는 경계 상자(oriented bounding boxes)를 직접 생성함으로써 자동차 및 보행자에 대한 드라이빙 환경에서의 물리적 타당성과 방향성을 고려한 잠재 확산 모델인 Scene Diffusion을 제안한다. 이는 다양한 자동차 및 보행자 배치를 생성할 수 있도록 객체 검출과 확산을 유연하게 통합한 미분 가능한 오토에코더 프레임워크를 기반으로 한다. 이 방법은 지ap 데이터를 조건으로 하여 고품질이고 다양한 장면을 생성할 수 있으며, 미국 내 다양한 지역으로의 일반화 능력이 뛰어나 히우리스틱 및 순차적 모델 대비 현실성과 다양성에서 뛰어난 성능을 보인다.

ABSTRACT

In this paper we describe a learned method of traffic scene generation designed to simulate the output of the perception system of a self-driving car. In our "Scene Diffusion" system, inspired by latent diffusion, we use a novel combination of diffusion and object detection to directly create realistic and physically plausible arrangements of discrete bounding boxes for agents. We show that our scene generation model is able to adapt to different regions in the US, producing scenarios that capture the intricacies of each region.

연구 동기 및 목표

  • 자율 주행 차량 시뮬레이션을 위한 다각도로 확장 가능하고, 물리적으로 타당한 다양한 교통 장면을 생성할 수 있는 유연한, 미분 가능한 방법을 개발하는 것.
  • 히우리스틱 및 순차적 모델의 한계를 해결하기 위해 지도 조건부 확산을 통한 엔드 투 엔드 학습을 통해 에이전트 레이아웃을 직접 학습하는 것.
  • 다양한 미국 지역의 실제 드라이빙 장면 분포를 모델링하여 시나리오의 다양성과 현실성을 향상시키는 것.
  • 후처리 없이 직접 방향성 있는 경계 상자를 생성함으로써 기하학적 및 의미적 일관성을 확보하는 것.
  • 자율 주행의 인지, 예측 및 계획 시스템 훈련 및 검증을 위한 고해상도 시뮬레이션을 가능하게 하는 것.

제안 방법

  • 조건부 변동 자동에코더(CVAE)는 에이전트의 위에서 본 시각 이미지를 잠재 공간으로 인코딩하고, 디코더는 방향성 있는 경계 상자를 출력한다.
  • 오토에코더는 예측된 경계 상자 매개변수 기반 복원 손실과 잠재 분포의 안정화를 위한 KL 정규화 항을 사용한다.
  • 잠재 확산 모델은 오토에코더의 잠재 임베딩을 학습하여 지도 이미지를 조건으로 하여 새로운 장면 구성 생성한다.
  • 확산 모델은 노이즈 예측 U-Net 아키텍처를 사용하며, 노이즈 제거 과정에서 지도 특징을 참조하기 위해 크로스 어텐션을 활용한다.
  • 추론 과정에서는 확산 모델이 잠재 코드를 생성하고, 학습된 오토에코더 디코더를 사용하여 방향성 있는 경계 상자로 디코딩한다.
  • 모델은 지역별 데이터셋으로 파생된 파라미터를 미세조정하여 미국 내 다양한 드라이빙 환경으로의 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1잠재 확산 모델이 드라이빙 장면에서 구조적이고 이산적인 에이전트 레이아웃(방향성 있는 경계 상자)을 효과적으로 생성하는 데 적합한가?
  • RQ2재학습 없이도 미세한 지역적 특성에 따라 미국 내 다양한 지리적 지역으로 일반화되는가?
  • RQ3히우리스틱 또는 순차적 방법 대비 엔드 투 엔드로 미분 가능한 방향성 있는 경계 상자 생성이 현실성과 다양성에서 뛰어난 성능을 보이는가?
  • RQ4최소한의 후처리로 복잡하고 물리적으로 타당한 교통 장면을 생성할 수 있는가?
  • RQ5객체 검출과 확산의 조합이 점유 맵 기반 GAN 대비 장면 생성 품질을 어떻게 향상시키는가?

주요 결과

  • Scene Diffusion 모델은 미국 내 여러 지역에서 다양한 현실적인 드라이빙 장면을 물리적으로 타당한 에이전트 배치로 성공적으로 생성한다.
  • 정성적 평가 결과, 모델이 생성한 장면은 지역별로 특화된 주행 행동과 인프라 패턴을 잘 반영하고 있다.
  • 미세조정 없이도 예측되지 않은 지역으로도 잘 일반화되어 있어, 장면 분포의 근본적인 학습 능력이 뛰어나다는 것을 시사한다.
  • 정량적 평가 결과, 순차적 및 GAN 기반 기준 모델 대비 장면의 다양성과 현실성에서 뛰어난 성능을 보였다.
  • 엔드 투 엔드로 미분 가능한 아키텍처는 후처리 단계 없이도 안정적인 학습과 고해상도 생성을 가능하게 했다.
  • 방향성에 대해 사인 및余현수인코딩을 사용함으로써 각도 불연속성 문제를 방지하고 객체 검출 정확도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.