Skip to main content
QUICK REVIEW

[论文解读] Generating Driving Scenes with Diffusion

Ethan Pronovost, Kai Wang|arXiv (Cornell University)|May 29, 2023
Computer Graphics and Visualization Techniques被引用 4
一句话总结

本文提出Scene Diffusion,一种潜在扩散模型,通过在可微分自编码器框架中结合目标检测与扩散机制,直接生成物理上合理的、具有方向的车辆和行人边界框。该方法基于地图数据实现高质量、多样化的场景生成,并在不同美国地区间表现出良好的泛化能力,在真实感和多样性方面优于启发式方法与自回归基线模型。

ABSTRACT

In this paper we describe a learned method of traffic scene generation designed to simulate the output of the perception system of a self-driving car. In our "Scene Diffusion" system, inspired by latent diffusion, we use a novel combination of diffusion and object detection to directly create realistic and physically plausible arrangements of discrete bounding boxes for agents. We show that our scene generation model is able to adapt to different regions in the US, producing scenarios that capture the intricacies of each region.

研究动机与目标

  • 开发一种可扩展的、可微分的方法,用于为自动驾驶仿真生成多样化且物理上合理的交通场景。
  • 通过端到端学习地图条件下的扩散模型来生成智能体布局,解决启发式与自回归场景生成方法的局限性。
  • 通过建模多个美国地区真实驾驶场景的分布,提升场景的多样性和真实感。
  • 直接生成具有方向的边界框,无需后处理,确保几何与语义一致性。
  • 为自动驾驶感知、预测与规划系统的训练与验证提供高保真度仿真环境。

提出的方法

  • 训练一个条件变分自编码器(CVAE),将智能体的鸟瞰图图像编码到潜在空间,解码器输出具有方向的边界框。
  • 自编码器采用基于预测边界框参数的重建损失,以及KL正则化项以稳定潜在分布。
  • 在自编码器的潜在嵌入上训练潜在扩散模型,以地图图像为条件,生成新颖的场景配置。
  • 扩散模型采用噪声预测U-Net架构,并通过交叉注意力机制在去噪过程中关注地图特征。
  • 推理阶段,扩散模型生成潜在码,再通过训练好的自编码器解码器解码为具有方向的边界框。
  • 在区域特定的数据集上对模型进行微调,以实现对不同美国驾驶环境的泛化能力。

实验结果

研究问题

  • RQ1潜在扩散模型能否有效适应于生成驾驶场景中结构化、离散的智能体布局(即具有方向的边界框)?
  • RQ2该模型在未见的美国地理区域中是否无需微调即可实现良好泛化?
  • RQ3端到端可微分的具有方向的边界框生成是否在真实感与多样性方面优于启发式或自回归方法?
  • RQ4该模型能否在极少后处理的情况下生成复杂且物理上合理的交通场景?
  • RQ5将目标检测与扩散机制结合,相较于基于占用图的GAN方法,能否显著提升场景生成质量?

主要发现

  • Scene Diffusion模型成功在多个美国地区生成多样化、逼真的驾驶场景,且智能体布局符合物理合理性。
  • 定性评估表明,模型生成的场景能够捕捉不同区域特有的驾驶行为与基础设施特征。
  • 在未见区域上无需微调即可实现良好泛化,表明模型已稳健学习到底层场景分布。
  • 定量评估显示,与自回归及GAN基线相比,该模型在场景多样性和真实感方面表现更优。
  • 端到端可微分架构实现了稳定训练与高保真生成,无需后处理步骤。
  • 采用正弦与余弦编码表示方向,避免了角度不连续性问题,提升了检测精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。