[论文解读] Certified Adversarial Robustness for Deep Reinforcement Learning
本文提出一种在线认证防御(CARRL),在受限输入扰动下计算状态-行动值的保证下界,以在深度强化学习任务中选择对对手和噪声鲁棒的行动。
Deep Neural Network-based systems are now the state-of-the-art in many robotics tasks, but their application in safety-critical domains remains dangerous without formal guarantees on network robustness. Small perturbations to sensor inputs (from noise or adversarial examples) are often enough to change network-based decisions, which was already shown to cause an autonomous vehicle to swerve into oncoming traffic. In light of these dangers, numerous algorithms have been developed as defensive mechanisms from these adversarial inputs, some of which provide formal robustness guarantees or certificates. This work leverages research on certified adversarial robustness to develop an online certified defense for deep reinforcement learning algorithms. The proposed defense computes guaranteed lower bounds on state-action values during execution to identify and choose the optimal action under a worst-case deviation in input space due to possible adversaries or noise. The approach is demonstrated on a Deep Q-Network policy and is shown to increase robustness to noise and adversaries in pedestrian collision avoidance scenarios and a classic control task.
研究动机与目标
- 在安全关键的机器人任务中,推动深度强化学习对鲁棒性保证的需求。
- 将鲁棒性认证方法适配并扩展到具有变量尺度输入的深度强化学习。
- 提供一种在线防御,通过使用最坏情况的Q值下界来选择行动。
- 在碰撞避免和倒立摆等领域展示鲁棒性提升。
提出的方法
- 将认证下界 Q_L(s_adv, a_j) 定义为在 s_adv 的 epsik 球内对 s 的最小值:Q_L(s_adv, a_j) = min_{s ∈ B_ε(s_adv)} Q_l(s, a_j)。
- 将鲁棒性认证扩展到向量值 ε,以处理不同输入尺度。
- 推出使用网络的 A 矩阵和 ReLU 边界参数的 Q_L 的闭式计算。
- 将 Q_L 集成到行动选择中,通过选择 a* = argmax_j Q_L(s_adv, a_j)。
- 将该方法应用于带有在线防御节点的深度Q网络(DQN)执行阶段。
- demonstrations 实时可行性(下界前向传播约 2ms,单个行动查询总时延约 20ms)。
实验结果
研究问题
- RQ1如何将鲁棒性认证适配到深度强化学习,以在输入扰动下提供保证?
- RQ2在认证边界中能否有效处理向量值输入扰动(不同传感器尺度)?
- RQ3在对抗性或带噪声的观测下,使用带认证下界的Q值是否能提高安全性和性能?
- RQ4认证防御对碰撞避免和经典控制任务的性能影响如何?
- RQ5对于实时在线执行的强化学习系统,认证防御是否可行?
主要发现
- 所提出的认证防御(CARRL)在碰撞避免场景中对抗扰动和噪声下减少了碰撞。
- 通过最大化 Q_L 实现鲁棒的行动选择,在扰动下改进奖励,同时在无扰动时保持名义性能。
- 将认证扩展到向量值扰动使得能够处理机器人观测中的 varied sensor scales。
- 该方法推广到 cartpole,显示在对噪声的鲁棒性方面有改进,同时在某些设置中损失较小。
- 运行时结果表明该防御可用于实时应用(给出前向传播时间和整体延迟)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。