Skip to main content
QUICK REVIEW

[论文解读] Learning to Collide: An Adaptive Safety-Critical Scenarios Generating Method

Wenhao Ding, Baiming Chen|arXiv (Cornell University)|Mar 2, 2020
Autonomous Vehicle Technology and Safety参考文献 37被引用 11
一句话总结

该论文提出了一种基于强化学习的框架,将驾驶算法视为环境,以训练生成模型自主发现关键安全性的交通场景。通过将场景建模为自回归构建模块,并使用策略梯度方法,该方法能够高效生成多样化、真实且适应路线和参数变化的高风险场景,在效率和适应性方面优于网格搜索和人工设计的方法。

ABSTRACT

Long-tail and rare event problems become crucial when autonomous driving algorithms are applied in the real world. For the purpose of evaluating systems in challenging settings, we propose a generative framework to create safety-critical scenarios for evaluating specific task algorithms. We first represent the traffic scenarios with a series of autoregressive building blocks and generate diverse scenarios by sampling from the joint distribution of these blocks. We then train the generative model as an agent (or a generator) to investigate the risky distribution parameters for a given driving algorithm being evaluated. We regard the task algorithm as an environment (or a discriminator) that returns a reward to the agent when a risky scenario is generated. Through the experiments conducted on several scenarios in the simulation, we demonstrate that the proposed framework generates safety-critical scenarios more efficiently than grid search or human design methods. Another advantage of this method is its adaptiveness to the routes and parameters.

研究动机与目标

  • 通过生成现实中难以收集的罕见、关键安全性的交通场景,解决自动驾驶中的长尾问题。
  • 克服网格搜索和人工设计场景的局限性,后者耗时且缺乏对不同路线和参数的适应性。
  • 开发一种可扩展、自适应的框架,为特定驾驶算法生成多样化、真实且高风险的场景。
  • 利用学习到的场景分布,在极端但合理的交通条件下高效评估自动驾驶系统。

提出的方法

  • 将交通场景表示为由自回归构建模块组成的因子化图模型,每个模块捕捉场景元素(如车辆位置、速度、路线)的条件概率。
  • 将生成过程建模为一个强化学习智能体,从这些构建模块的联合分布中采样以生成场景。
  • 将目标驾驶算法视为环境,智能体在生成更高风险场景时获得更高奖励,从而引导探索向关键安全配置方向进行。
  • 使用策略梯度强化学习(具体为REINFORCE)优化生成器,输入状态包括路线和目标速度等任务特定参数。
  • 在训练期间对输入状态进行均匀采样,以确保在多样化驾驶条件和未见参数组合下的适应性。
  • 在构建模块设计中引入人类先验知识,以确保场景的真实性和多样化交通交互中的结构一致性。

实验结果

研究问题

  • RQ1是否可以训练一个深度生成模型,无需依赖详尽的网格搜索或人类直觉,高效发现关键安全性的交通场景?
  • RQ2如何使生成模型适应不同的驾驶路线和算法参数(如目标速度)?
  • RQ3与基线方法相比,该方法在生成罕见高风险场景方面的效率和多样性提升程度如何?
  • RQ4该框架能否生成多模态、真实的高风险场景,且与现实世界事故统计数据和交通动态一致?

主要发现

  • 所提方法在生成关键安全场景方面显著快于网格搜索或人工设计方法,计算成本更低,可扩展性更强。
  • 该框架展现出强大的适应性:在无需微调的情况下,能为新路线和输入参数生成相关高风险场景,即使这些设置未出现在训练分布中。
  • 在四个真实世界易出事故场景(闯红灯、无保护左转、信号灯控制路口右转)上的实验表明,该方法成功识别出高风险参数分布。
  • 高风险场景的解空间具有多模态和非凸性,该方法发现了多个稳定的策略解,表明其对多样化风险配置的稳健探索。
  • 与网格搜索相比,该方法在不同路线和速度下的性能方差更低,后者需为每个新设置从头开始重新运行。
  • 可视化结果证实,生成的场景具有现实感,且与真实事故报告中观察到的实际事故前状态相似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。