Skip to main content
QUICK REVIEW

[论文解读] The Adaptive Stress Testing Formulation

Mark Koren, Anthony Corso|arXiv (Cornell University)|Apr 8, 2020
Probabilistic and Robust Engineering Design参考文献 11被引用 9
一句话总结

本文提出自适应压力测试(AST),一种基于强化学习的方法,将自动驾驶系统的故障验证问题建模为马尔可夫决策过程(MDP),以在复杂仿真环境中高效识别最可能的故障场景。通过使用强调轨迹可能性和事件发生的结构化奖励函数,AST 实现了可处理的、高保真的验证,同时不简化场景复杂度。

ABSTRACT

Validation is a key challenge in the search for safe autonomy. Simulations are often either too simple to provide robust validation, or too complex to tractably compute. Therefore, approximate validation methods are needed to tractably find failures without unsafe simplifications. This paper presents the theory behind one such black-box approach: adaptive stress testing (AST). We also provide three examples of validation problems formulated to work with AST.

研究动机与目标

  • 解决在高维、复杂环境中验证自动驾驶系统时,全面仿真不可行的挑战。
  • 克服简化仿真带来的局限性,避免遗漏罕见但关键的故障模式。
  • 开发一种黑箱、可扩展的验证方法,在保持完整仿真复杂度的同时识别最可能的故障轨迹。
  • 利用强化学习与概率建模,实现自动驾驶系统中实用且高效的故障发现。
  • 提供一种可推广的框架,适用于机器人控制、自动驾驶汽车和空中交通系统等多种领域。

提出的方法

  • 将故障验证问题建模为马尔可夫决策过程(MDP),将仿真器视为黑箱。
  • 定义三种核心仿真器交互函数:Initialize(重置至初始状态)、Step(使用环境动作推进仿真)、IsTerminal(检查是否发生事件或达到时域终点)。
  • 设计一种奖励函数,以最大化故障诱导轨迹的对数似然:在故障发生时奖励为零,非故障终止状态受到惩罚,非终止步骤的奖励为动作的负对数概率。
  • 可选地引入启发式函数(如行人与车辆之间的距离)以在训练期间加速收敛。
  • 使用与环境动作概率对数成比例的动作奖励项(例如 log-P(a)),以确保累积奖励反映轨迹的似然性。
  • 应用强化学习算法(如蒙特卡洛树搜索(MCTS)或信任区域策略优化(TRPO))来优化策略,以找到最可能的故障。

实验结果

研究问题

  • RQ1如何在不简化仿真环境的前提下,高效识别自动驾驶系统中最可能的故障?
  • RQ2何种奖励函数结构可使强化学习优先关注高可能性的故障轨迹而非低可能性轨迹?
  • RQ3启发式函数如何在不偏倚故障搜索的前提下提升自适应压力测试的收敛速度?
  • RQ4AST 在机器人控制、自动驾驶汽车和空中交通系统等多样化自动驾驶系统中,如何实现泛化?
  • RQ5AST 在模型精度和局部收敛性方面存在哪些局限性,又该如何缓解?

主要发现

  • AST 通过优化优先考虑高可能性、故障诱导路径的奖励函数,成功识别出仿真中的最可能故障轨迹。
  • 在带扰动的倒立摆场景中,基于最终状态到故障状态距离的启发式方法显著加速了训练过程中的收敛。
  • 在自动驾驶汽车过街场景中,基于马氏距离的动作奖励提高了探索效率,通过优先考虑合理的行人运动模式和传感器噪声模式。
  • 在 ACASX 飞机防撞场景中,使用仿真器状态转移的对数概率作为动作奖励,即使在仿真器高度复杂的情况下,也实现了有效优化。
  • 即使对非故障终止状态施加了较大的惩罚(α = 1e5),该算法仍能收敛至高可能性的故障场景。
  • AST 通过保留完整仿真复杂度,避免了不安全的简化,同时借助强化学习驱动的探索,实现了可处理的故障发现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。