[论文解读] Falsification-Based Robust Adversarial Reinforcement Learning
本文提出了一种基于验证的鲁棒对抗强化学习(FRARL)框架,通过使用基于时序逻辑的安全性验证技术,自动生成无需人工设计奖励函数的对抗性训练场景。通过使用度量时序逻辑(MTL)规范引导发现安全性关键场景,FRARL使强化学习策略更具鲁棒性并更好地遵守安全约束,在HighD和随机驾驶场景等未见测试环境中显著减少了违规行为。
Reinforcement learning (RL) has achieved enormous progress in solving various sequential decision-making problems, such as control tasks in robotics. Since policies are overfitted to training environments, RL methods have often failed to be generalized to safety-critical test scenarios. Robust adversarial RL (RARL) was previously proposed to train an adversarial network that applies disturbances to a system, which improves the robustness in test scenarios. However, an issue of neural network-based adversaries is that integrating system requirements without handcrafting sophisticated reward signals are difficult. Safety falsification methods allow one to find a set of initial conditions and an input sequence, such that the system violates a given property formulated in temporal logic. In this paper, we propose falsification-based RARL (FRARL): this is the first generic framework for integrating temporal logic falsification in adversarial learning to improve policy robustness. By applying our falsification method, we do not need to construct an extra reward function for the adversary. Moreover, we evaluate our approach on a braking assistance system and an adaptive cruise control system of autonomous vehicles. Our experimental results demonstrate that policies trained with a falsification-based adversary generalize better and show less violation of the safety specification in test scenarios than those trained without an adversary or with an adversarial network.
研究动机与目标
- 为解决强化学习(RL)策略在安全关键型现实环境(尤其是自动驾驶)中泛化失败的问题。
- 克服为针对安全关键行为的对抗性RL智能体设计有效奖励函数的困难。
- 将形式化验证技术——特别是时序逻辑验证——整合到对抗性RL中,以自动生成具有挑战性的、导致安全违规的场景。
- 通过在经验证的、安全性关键的场景下进行训练,而非随机或启发式对抗输入,来提升策略的鲁棒性。
- 证明基于验证的对抗训练策略在未见测试环境中的泛化能力更强,且违反安全规范的频率低于标准或RARL方法训练的策略。
提出的方法
- 使用度量时序逻辑(MTL)表述安全性要求,以定义系统行为的形式化规范。
- 应用安全性验证方法,自动搜索导致系统违反MTL规范的初始状态和输入序列。
- 将验证发现的场景作为对抗性训练数据提供给RL智能体,无需为对手设计独立的奖励函数。
- 在集成验证测试用例的环境中,使用近端策略优化(PPO)训练RL策略。
- 在训练过程中迭代集成验证引擎,持续生成更具挑战性的安全性关键场景。
- 在未见的测试场景(包括HighD和随机采样的驾驶条件)上评估训练后的策略,以衡量其鲁棒性和安全性合规性。
实验结果
研究问题
- RQ1基于时序逻辑的验证是否能有效用于生成无需人工奖励函数的RL对抗性训练场景?
- RQ2与标准或RARL方法相比,基于验证的安全性关键场景训练是否能提升RL策略在未见测试环境中的泛化能力?
- RQ3所提出的FRARL框架在多大程度上减少了自动驾驶系统中安全距离和倒车行为等安全规范的违规?
- RQ4在HighD和随机测试场景中,FRARL在回合奖励和安全违规率方面与PPO和RARL相比表现如何?
- RQ5基于验证的对抗智能体是否能发现比依赖奖励最大化的传统对抗性RL方法更多的关键故障模式?
主要发现
- 在制动辅助系统上,FRARL在HighD测试场景中实现了0%的碰撞率和0.015%的倒车率,优于RARL(2.70%碰撞率,0.009%倒车率)和PPO(4.59%碰撞率,0.34%倒车率)。
- 在随机测试场景中,FRARL将ACC的碰撞率降低至0.025%,BA系统降低至0.0018%,而RARL和PPO分别达到3.59%和6.05%。
- FRARL在制动辅助系统上仅用一半的训练步数就收敛至零回合奖励,表明学习速度更快且策略更稳定。
- 在所有测试场景中,FRARL在回合奖励和安全距离违规方面的方差更低,表明策略性能更一致。
- FRARL展现出更优的泛化能力,在随机测试场景中的性能提升幅度大于HighD场景,表明验证生成的场景更能暴露并训练应对未见故障模式。
- 该方法在随机测试场景中成功消除了两种系统的所有倒车和近零碰撞事件,使ACC在FRARL下的倒车和碰撞违规率均达到0%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。