[论文解读] Automatic Testing and Falsification with Dynamically Constrained Reinforcement Learning
本文提出了一种以智能体为中心的强化学习框架,通过在信号时序逻辑(STL)中表达动态约束规则,训练对抗性智能体以实现对网络物理系统(如自动驾驶汽车)的自动测试与 falsification。该方法可生成模块化、可重用的智能体,在尊重分层交通规则的前提下,发现传统 falsification 方法可检测的所有危险行为,已在两个汽车案例研究中得到验证。
We consider the problem of using reinforcement learning to train adversarial agents for automatic testing and falsification of cyberphysical systems, such as autonomous vehicles, robots, and airplanes. In order to produce useful agents, however, it is useful to be able to control the degree of adversariality by specifying rules that an agent must follow. For example, when testing an autonomous vehicle, it is useful to find maximally antagonistic traffic participants that obey traffic rules. We model dynamic constraints as hierarchically ordered rules expressed in Signal Temporal Logic, and show how these can be incorporated into an agent training process. We prove that our agent-centric approach is able to find all dangerous behaviors that can be found by traditional falsification techniques while producing modular and reusable agents. We demonstrate our approach on two case studies from the automotive domain.
研究动机与目标
- 开发一种基于强化学习的方法,用于自动驾驶汽车和飞机等网络物理系统的自动测试与 falsification。
- 通过在信号时序逻辑(STL)中编码分层排序的动态约束规则,实现对对抗性行为的控制。
- 确保训练后的智能体能够发现传统 falsification 技术可识别的所有危险系统行为。
- 生成尊重现实运行约束(如交通规则)的模块化、可重用智能体。
- 在涉及复杂交通场景的真实世界汽车案例研究中验证该方法。
提出的方法
- 将动态约束以分层排序的规则形式在信号时序逻辑(STL)中建模,实现对有效行为的结构化规范。
- 将 STL 约束集成到强化学习训练过程中,引导智能体在可行且现实的行为空间内进行探索。
- 采用以智能体为中心的训练范式,使每个智能体在遵守指定 STL 规则的前提下,最大化其对抗性。
- 设计奖励函数以惩罚约束违规行为,并鼓励在符合规则的对抗性条件下发现系统故障。
- 通过分层规则执行机制,在训练期间优先保障关键安全约束,确保符合交通法规。
- 使用深度强化学习端到端训练智能体,通过基于 STL 的奖励塑造和约束执行指导策略优化。
实验结果
研究问题
- RQ1能否训练强化学习智能体在尊重现实规则约束的前提下,发现网络物理系统中的危险行为?
- RQ2将分层信号时序逻辑(STL)约束纳入后,对对抗性测试智能体的有效性与安全性有何影响?
- RQ3所提出的以智能体为中心的方法能否实现与传统 falsification 技术相当的故障模式覆盖范围?
- RQ4训练后的智能体在多大程度上可实现跨不同测试场景的模块化与可重用性?
- RQ5与无约束的对抗性智能体相比,动态约束智能体在现实性与测试覆盖率方面表现如何?
主要发现
- 所提出的方法成功发现了传统 falsification 技术可检测的所有危险行为,确保了完整覆盖。
- 采用 STL 约束训练的智能体生成了符合规则、现实的对抗性行为,可模拟合理的交通场景。
- 约束的分层执行机制确保了在智能体训练过程中关键安全规则永远不会被违反。
- 以智能体为中心的设计实现了跨不同测试场景和系统配置的模块化与可重用性。
- 该方法在保持操作真实性的前提下实现了有效的测试覆盖率,已在两个汽车案例研究中得到验证。
- 将 STL 约束集成到强化学习训练循环中,实现了网络物理系统可扩展且可验证的对抗性测试。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。