[论文解读] On the Robustness of Safe Reinforcement Learning under Observational Perturbations
本文研究了安全强化学习(RL)策略在观测对抗扰动下的脆弱性,提出了两种新颖的攻击方法——代价最大化(cost maximization)和奖励最大化(reward maximization),揭示了关键的安全性缺陷。本文还引入了一种基于这些攻击的鲁棒训练框架,在多个连续控制环境中验证了该方法在对抗条件下提升约束满足能力的有效性。
Safe reinforcement learning (RL) trains a policy to maximize the task reward while satisfying safety constraints. While prior works focus on the performance optimality, we find that the optimal solutions of many safe RL problems are not robust and safe against carefully designed observational perturbations. We formally analyze the unique properties of designing effective observational adversarial attackers in the safe RL setting. We show that baseline adversarial attack techniques for standard RL tasks are not always effective for safe RL and propose two new approaches - one maximizes the cost and the other maximizes the reward. One interesting and counter-intuitive finding is that the maximum reward attack is strong, as it can both induce unsafe behaviors and make the attack stealthy by maintaining the reward. We further propose a robust training framework for safe RL and evaluate it via comprehensive experiments. This paper provides a pioneer work to investigate the safety and robustness of RL under observational attacks for future safe RL studies. Code is available at: \url{https://github.com/liuzuxin/safe-rl-robustness}
研究动机与目标
- 研究安全强化学习策略在观测对抗扰动下的脆弱性,特别是在安全关键应用中的表现。
- 识别现有对抗攻击方法在标准强化学习中应用于安全强化学习时的局限性,因为约束违反可能造成灾难性后果。
- 设计适用于安全强化学习的有效对抗性攻击方法,能够在保持隐蔽性或最大化代价的同时诱导不安全行为。
- 开发一种鲁棒训练框架,提升策略在最坏情况观测扰动下的鲁棒性,同时保持安全约束。
- 在多种安全强化学习算法和环境中验证所提方法的有效性,证明其在约束满足方面的鲁棒性提升。
提出的方法
- 提出两种针对安全强化学习的新对抗攻击策略:(1) 代价最大化(MC),直接增加约束违反;(2) 奖励最大化(MR),诱导高风险、高奖励行为,可能导致不安全结果。
- 引入一种鲁棒训练框架,在策略优化过程中同时使用MC和MR攻击,使智能体能够学习对最坏情况扰动具有鲁棒性的策略。
- 采用MC与MR目标的线性组合作为混合攻击器,以评估在多样化对抗场景下的鲁棒性。
- 对SAC-Lagrangian、FOCOPS和CVPO应用对抗性训练,利用所提攻击方法更新策略和价值网络,提升鲁棒性。
- 理论分析表明,所提攻击下贝尔曼算子具有收缩性质,支持训练过程的收敛性与稳定性。
- 使用超参数加权的混合攻击器(w × MC + (1−w) × MR)评估在不同攻击强度及奖励与代价目标之间权衡下的鲁棒性。
实验结果
研究问题
- RQ1安全强化学习策略在观测对抗扰动下有多脆弱,特别是在约束违反方面?
- RQ2为何标准对抗攻击方法(如奖励最小化)在安全强化学习设置中无效或不足?
- RQ3在保持隐蔽性的同时,奖励最大化攻击是否比代价最大化攻击更有效诱导不安全行为?
- RQ4使用所提攻击方法进行对抗性训练是否能提升在最坏情况扰动下约束满足的鲁棒性?
- RQ5在混合对抗攻击下,鲁棒训练策略在不同安全强化学习算法和环境中的表现如何比较?
主要发现
- 即使在干净环境中满足安全约束,安全强化学习问题的最优解仍对观测对抗扰动具有脆弱性。
- 最大奖励攻击(MR)在诱导不安全行为方面极为有效,且具有隐蔽性,因为它保持高任务奖励,难以被检测。
- 原始安全RL智能体(如SAC-Lagrangian、FOCOPS、CVPO)在MC和MR攻击下遭受严重约束违反,代价在Car-Circle中最高上升112.53,在Car-Run中最高上升184.22。
- 对抗性训练策略(ADV-PPOL、ADV-CVPO)在MC和MR攻击下维持接近零的代价(如0.02–0.08),同时获得高奖励,表现出显著鲁棒性。
- 混合攻击器(MC:MR = 1:1)持续降低原始策略的性能,但鲁棒训练智能体仍保持稳定与安全,表明其对攻击类型的泛化能力。
- 在Car-Run中α=0.01时,ADV-PPOL(MR)智能体在MR攻击下获得557.07 ± 3.05的奖励与0.02 ± 0.13的代价,而原始PPOL智能体获得624.68 ± 8.85的奖励但代价高达184.22 ± 0.45,凸显了非鲁棒策略在奖励与安全之间的权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。