[论文解读] Adaptive Stress Testing for Autonomous Vehicles
该论文提出了一种基于强化学习的自适应压力测试(AST)框架,用于自动驾驶汽车,以高效识别模拟中的高概率故障场景。通过将问题建模为马尔可夫决策过程,并对比蒙特卡洛树搜索(MCTS)与深度强化学习(DRL),作者表明DRL在模拟器调用次数少两个数量级以上的情况下,能够找到更可能的故障场景,显著提升了效率。
This paper presents a method for testing the decision making systems of autonomous vehicles. Our approach involves perturbing stochastic elements in the vehicle's environment until the vehicle is involved in a collision. Instead of applying direct Monte Carlo sampling to find collision scenarios, we formulate the problem as a Markov decision process and use reinforcement learning algorithms to find the most likely failure scenarios. This paper presents Monte Carlo Tree Search (MCTS) and Deep Reinforcement Learning (DRL) solutions that can scale to large environments. We show that DRL can find more likely failure scenarios than MCTS with fewer calls to the simulator. A simulation scenario involving a vehicle approaching a crosswalk is used to validate the framework. Our proposed approach is very general and can be easily applied to other scenarios given the appropriate models of the vehicle and the environment.
研究动机与目标
- 应对在庞大而复杂的驾驶场景空间中验证自动驾驶汽车决策系统所面临的挑战。
- 提升在模拟中寻找高概率故障场景的效率,因为在罕见碰撞事件下直接的蒙特卡洛采样不可行。
- 将此前用于飞机的AST方法论扩展至自动驾驶汽车,采用强化学习技术。
- 对比MCTS与DRL作为AST求解器的性能,评估其在识别故障场景方面的效率与有效性。
- 开发一个模块化仿真框架,支持车辆、传感器和动力学模型的即插即用式替换,以实现灵活测试。
提出的方法
- 将自适应压力测试问题建模为马尔可夫决策过程(MDP),目标是通过环境扰动最大化碰撞概率。
- 使用带双层渐进扩展(DPW)的蒙特卡洛树搜索(MCTS)来探索状态空间,并通过基于树的采样识别故障场景。
- 采用深度强化学习(DRL)实现,其策略网络从高斯分布中输出动作均值,动作通过随机采样获得。
- 采用广义优势估计(GAE)从仿真轨迹中计算策略梯度,实现高效的策略优化。
- 定义奖励函数以最大化碰撞概率,状态空间包括车辆位置、行人行为及传感器噪声。
- 采用基于汽车驾驶模型(ADM)仿真器的模块化仿真框架,支持决策系统、传感器和动力学模型的即插即用式替换。
实验结果
研究问题
- RQ1深度强化学习是否能在识别自动驾驶汽车的高概率故障场景方面优于蒙特卡洛树搜索?
- RQ2在找到故障场景所需的模拟器调用次数方面,DRL与MCTS相比效率如何?
- RQ3AST框架在不同环境模型下的其他自动驾驶汽车场景中有多大程度的可扩展性?
- RQ4MCTS与DRL生成的行人与车辆轨迹有何差异?这些差异揭示了故障场景质量的哪些信息?
- RQ5通过重新定义关注的事件空间,聚焦于自动驾驶车辆自身责任的故障,能否进一步增强AST?
主要发现
- DRL在所需模拟器调用次数不足MCTS的1%的情况下,找到了比MCTS更可能的故障场景,证明了其卓越的效率。
- 在所有测试场景——单个行人、双行人以及不同行人起始位置下,DRL在收敛速度和解决方案质量方面均持续优于MCTS。
- DRL生成的行人轨迹更平滑,所需加速度更小,表明其生成的故障路径更具可实现性和可能性,而MCTS则产生突兀且高加速度的机动动作。
- MCTS在多智能体场景中(如双行人情况)难以处理耦合效应,例如第一个行人的次优路径会降低整体奖励效率。
- 该框架成功识别出一个场景(场景2),其根本原因在于车辆未能及时检测到行人,凸显了重新定义关注事件空间以聚焦于系统自身责任的必要性。
- 模块化仿真框架支持轻松集成不同传感器模型、决策系统和环境动力学,具备广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。