Skip to main content
QUICK REVIEW

[论文解读] Adaptive Stress Testing with Reward Augmentation for Autonomous Vehicle Validation

Anthony Corso, Peter Du|arXiv (Cornell University)|Aug 2, 2019
Vehicle Dynamics and Control Systems参考文献 15被引用 21
一句话总结

本文通过整合责任敏感安全(RSS)原则和轨迹差异性度量,提出对自动驾驶车辆验证中的自适应压力测试(AST)进行奖励增强。通过修改AST奖励函数以优先关注自动驾驶车辆行为不当的故障情形,并提升发现的故障模式多样性,该方法识别出更广泛、更相关的故障场景——通过故障多样性提升以及发现基线AST中未出现的车辆引发碰撞现象得到验证。

ABSTRACT

Determining possible failure scenarios is a critical step in the evaluation of autonomous vehicle systems. Real-world vehicle testing is commonly employed for autonomous vehicle validation, but the costs and time requirements are high. Consequently, simulation-driven methods such as Adaptive Stress Testing (AST) have been proposed to aid in validation. AST formulates the problem of finding the most likely failure scenarios as a Markov decision process, which can be solved using reinforcement learning. In practice, AST tends to find scenarios where failure is unavoidable and tends to repeatedly discover the same types of failures of a system. This work addresses these issues by encoding domain relevant information into the search procedure. With this modification, the AST method discovers a larger and more expressive subset of the failure space when compared to the original AST formulation. We show that our approach is able to identify useful failure scenarios of an autonomous vehicle policy.

研究动机与目标

  • 解决AST在自动驾驶车辆验证中仅能发现不可避免或重复性故障场景的局限性。
  • 通过引入责任敏感安全(RSS)框架中的领域特定知识,提升AST的相关性。
  • 通过在奖励函数中引入轨迹差异性度量,提升故障模式的多样性。
  • 通过识别与策略相关的有意义弱点,实现更有效的基于仿真的自动驾驶车辆策略验证。
  • 证明奖励增强可发现比标准AST更具信息量的故障案例。

提出的方法

  • 在AST奖励函数中引入基于RSS的规则,对自动驾驶车辆未能对潜在碰撞做出适当响应的情形进行惩罚。
  • 引入一种轨迹差异性度量,通过测量状态轨迹之间的差异,鼓励探索不同的故障模式。
  • 在仿真环境中使用蒙特卡洛树搜索(MCTS)优化在增强奖励函数下的策略。
  • 基于车辆、行人与自动驾驶车辆之间距离阈值(例如,<0.5m)定义故障状态。
  • 在两辆汽车、两名行人的横穿路口场景中应用增强奖励函数,以评估性能。
  • 通过定量的故障类型统计和视觉轨迹分析,对比通用AST与结合RSS及差异性奖励的AST结果。

实验结果

研究问题

  • RQ1基于RSS的奖励增强是否能提升AST检测自动驾驶车辆响应不当故障的能力?
  • RQ2引入轨迹差异性度量是否能提升AST发现的故障模式多样性?
  • RQ3增强后的AST方法与基线AST相比,在识别相关且能揭示策略弱点的故障场景方面表现如何?
  • RQ4RSS与差异性奖励的结合是否能发现标准AST中未发现的车辆引发的故障?
  • RQ5奖励增强在多大程度上减少了收敛至单一、无信息量故障模式的现象?

主要发现

  • 在使用通用AST奖励时,25起故障中有25起均为行人引发的类型,即停止的自动驾驶车辆与进入其路径的行人发生碰撞。
  • RSS奖励增强成功引导AST发现4起车辆/行人故障,其中自动驾驶车辆未能适当地刹车,表明存在行为不当。
  • 轨迹差异性(TD)奖励使AST发现6起车辆/车辆故障,其中后方车辆靠近过近,暴露出策略缺陷。
  • TD奖励方法提升了故障多样性,识别出基线AST设置中未发现的车辆引发及车辆/车辆故障模式。
  • 结果表明,与标准AST相比,奖励增强使故障空间更具表现力和相关性。
  • 视觉分析确认,增强后的AST方法生成的轨迹更具多样性,且表现出更真实、更能揭示策略问题的故障模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。