Skip to main content
QUICK REVIEW

[论文解读] SceneGen: Learning to Generate Realistic Traffic Scenes

Shuhan Tan, Kelvin Wong|arXiv (Cornell University)|Jan 16, 2021
Autonomous Vehicle Technology and Safety参考文献 23被引用 6
一句话总结

SceneGen 提出了一种深度生成模型,通过基于可行驶地图和自车状态的条件输入,学习生成逼真、多样且语义一致的交通场景。该模型采用基于 ConvLSTM 的架构,并对参与者类别、位置、尺寸和朝向等属性建模条件分布,能够生成具有高度真实感和多模态特性的场景,在 MMD 指标上优于基线方法,且能生成罕见但合理的交通行为,如三点转向和复杂行人横穿。

ABSTRACT

We consider the problem of generating realistic traffic scenes automatically. Existing methods typically insert actors into the scene according to a set of hand-crafted heuristics and are limited in their ability to model the true complexity and diversity of real traffic scenes, thus inducing a content gap between synthesized traffic scenes versus real ones. As a result, existing simulators lack the fidelity necessary to train and test self-driving vehicles. To address this limitation, we present SceneGen, a neural autoregressive model of traffic scenes that eschews the need for rules and heuristics. In particular, given the ego-vehicle state and a high definition map of surrounding area, SceneGen inserts actors of various classes into the scene and synthesizes their sizes, orientations, and velocities. We demonstrate on two large-scale datasets SceneGen's ability to faithfully model distributions of real traffic scenes. Moreover, we show that SceneGen coupled with sensor simulation can be used to train perception models that generalize to the real world.

研究动机与目标

  • 开发一种数据驱动的生成模型,用于为自动驾驶仿真生成逼真且多样的交通场景。
  • 建模超越简单启发式规则的复杂多模态交通行为,包括罕见但合理的操作,如三点转向和共用车道横穿。
  • 通过在参与者属性上使用分类分布和混合分布来建模不确定性,提升场景级真实感。
  • 实现基于静态高清地图和自车状态的可控交通场景生成,支持下游仿真与训练任务。

提出的方法

  • 采用 320×320 俯视图输入表示,以多通道栅格化格式编码高清地图元素(车道、可行驶区域、人行横道)、交通信号、限速信息以及参与者状态(位置、朝向、速度)。
  • 使用两层 ConvLSTM(32 个隐藏通道,5×5 卷积核)编码时空场景上下文,随后通过五层 CNN 主干网络进行特征提取。
  • 通过条件概率分布预测参与者属性:类别通过三层 MLP 输出 softmax 概率,位置通过 0.25m 网格单元的均匀量化与分类分布建模。
  • 使用 K 个二元对数正态分布的混合模型对边界框尺寸进行建模,参数由三层次 MLP 预测,包含对数方差与相关性项,以确保协方差矩阵正定。
  • 使用 K 个 Von-Mises 分布的混合模型对朝向角度进行建模,参数由独立 MLP 预测,支持循环分布建模。
  • 采用类似 nucleus sampling 的策略,每步生成 M 个候选样本,从中选择最可能的样本,以提升生成结果的真实感。
Figure 1 : The input multi-channel image to SceneGen for ATG4D.
Figure 1 : The input multi-channel image to SceneGen for ATG4D.

实验结果

研究问题

  • RQ1深度生成模型能否同时生成逼真且多样的交通场景,捕捉难以通过启发式方法建模的复杂多模态行为?
  • RQ2学习模型在多大程度上能泛化到罕见但合理的交通场景,如三点转向或骑行人共用车道操作?
  • RQ3样本候选数 M 的大小如何影响生成场景的真实感与多样性,特别是在场景级统计指标上的表现?
  • RQ4模型能否准确表示参与者位置的空间不确定性,例如在人行横道上的弥散分布或车道中心线上的集中分布?
  • RQ5与基于启发式规则及其他学习基线方法相比,该模型在捕捉真实世界交通场景统计分布方面表现如何?

主要发现

  • 在 ATG4D 和 Argoverse 基准测试中,SceneGen 在所有对比方法中实现了最低的 Fréchet Motion Distance (FMD) 和 Multi-scale Structural Similarity (MSSIM) 指标。
  • 在 ATG4D 上,SceneGen 在仅车辆的场景统计中 MMD 达到 0.042,显著优于 MetaSim (0.071) 和 Lane Graph (0.063),表明其在参与者级分布上的真实感更优。
  • 使用 M=20 个候选样本相比 M=1 时,深度特征的 MMD 降低 15%,表明增加采样数量可提升场景级真实感并减少模式崩溃。
  • 定性结果表明,SceneGen 能生成罕见但合理的交通行为,如骑行人使用车行道完成三点转向或左转,而基线模型中则完全缺失此类行为。
  • 该模型展现出高度的生成多样性:相同输入(SDV 状态与地图)生成的多个样本呈现出截然不同的场景配置,如行人横穿、无保护左转、公交车在路口直行等。
  • 热力图可视化结果证实,模型学习到了有意义的空间不确定性:车辆位置集中在车道中心线上,而行人位置则弥散分布在人行道与人行横道上。
Figure 2 : Traffic scenes generated by SceneGen using $M=1,10,20$ sample proposals for ATG4D.
Figure 2 : Traffic scenes generated by SceneGen using $M=1,10,20$ sample proposals for ATG4D.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。