Skip to main content
QUICK REVIEW

[论文解读] Certifiable Robustness to Adversarial State Uncertainty in Deep Reinforcement Learning

Michael Everett, Björn Lütjens|arXiv (Cornell University)|Apr 11, 2020
Adversarial Robustness in Machine Learning参考文献 72被引用 36
一句话总结

本文提出 CARRL,一种可认证鲁棒的深度强化学习框架,通过鲁棒优化计算在传感器噪声或对抗性攻击引起的最坏情况输入扰动下状态动作值的保证下界。即使真实状态未知,CARRL 也能提供解质量的认证,从而在安全关键环境中实现安全的动作选择,在行人碰撞避免和 Atari Pong 任务中展示了具有可证明性能保证的改进鲁棒性。

ABSTRACT

Deep Neural Network-based systems are now the state-of-the-art in many robotics tasks, but their application in safety-critical domains remains dangerous without formal guarantees on network robustness. Small perturbations to sensor inputs (from noise or adversarial examples) are often enough to change network-based decisions, which was recently shown to cause an autonomous vehicle to swerve into another lane. In light of these dangers, numerous algorithms have been developed as defensive mechanisms from these adversarial inputs, some of which provide formal robustness guarantees or certificates. This work leverages research on certified adversarial robustness to develop an online certifiably robust for deep reinforcement learning algorithms. The proposed defense computes guaranteed lower bounds on state-action values during execution to identify and choose a robust action under a worst-case deviation in input space due to possible adversaries or noise. Moreover, the resulting policy comes with a certificate of solution quality, even though the true state and optimal action are unknown to the certifier due to the perturbations. The approach is demonstrated on a Deep Q-Network policy and is shown to increase robustness to noise and adversaries in pedestrian collision avoidance scenarios and a classic control task. This work extends one of our prior works with new performance guarantees, extensions to other RL algorithms, expanded results aggregated across more scenarios, an extension into scenarios with adversarial behavior, comparisons with a more computationally expensive method, and visualizations that provide intuition about the robustness algorithm.

研究动机与目标

  • 解决深度强化学习策略在缺乏形式化鲁棒性保证的问题,尤其是在传感器噪声或对抗性输入扰动下。
  • 克服标准 DRL 智能体在微小输入扰动下失效的局限性,例如导致自动驾驶车辆偏离车道。
  • 开发一种方法,在无需微调或改变底层策略的情况下,为输入不确定性提供形式化、可认证的鲁棒性。
  • 确保所得到的策略附带可验证的解质量认证,即使由于扰动导致真实状态和最优动作未知。
  • 将高效鲁棒性验证技术从监督学习扩展到深度强化学习,适应控制任务中常见的异构输入尺度。

提出的方法

  • 构建一个鲁棒优化问题,选择在观测输入周围 ϵ-球内所有可能状态扰动下的最坏情况值最大化的动作。
  • 使用松弛化的鲁棒性验证技术(例如,ReLU 激活函数的 Fast-Lin 风格线性松弛)高效计算在输入不确定性下的 Q 值保证下界。
  • 引入向量形式的 ϵ 以处理具有不同尺度的输入(例如,位置、角度、扭矩),从而支持在机器人控制任务中的应用。
  • 通过下界和名义 Q 值,推导出次优性的认证,即通过边界估计鲁棒动作值与真实(未知)状态下的最优值之间的差距。
  • 将鲁棒决策模块作为后处理层集成到预训练的 DQN 之上,实现在无需微调情况下的部署。
  • 将该框架扩展至基于策略的强化学习算法及涉及对抗性智能体的情境,证明其在图像攻击之外的泛化能力。

实验结果

研究问题

  • RQ1我们能否在对抗性或噪声状态观测下,为深度强化学习智能体提供形式化、可认证的鲁棒性保证?
  • RQ2如何在保持计算效率的同时,为最坏情况输入扰动下的 Q 值计算保证下界?
  • RQ3我们能否将监督学习中的鲁棒性验证技术扩展到深度强化学习,特别是针对具有异构输入尺度的环境?
  • RQ4与非认证基线和计算成本更高的替代方法相比,该方法在鲁棒性和解质量方面的表现如何?
  • RQ5该框架能否扩展到涉及环境内对抗行为的情境,例如竞争性智能体或动态障碍物?

主要发现

  • CARRL 显著降低了行人碰撞避免场景中的碰撞率,展示了在对抗性状态扰动下的改进鲁棒性。
  • 在带噪声观测的 CartPole 控制任务中,该方法提高了平均回合回报,表现出更优的性能稳定性。
  • 在 Atari Pong 中,CARRL 增强的 DQN 策略在对抗性输入攻击下获得了更高的奖励和更强的鲁棒性,优于标准 DQN。
  • 该算法提供了可验证的次优性认证,量化了鲁棒动作与真实状态下最优动作之间的差距,即使真实状态未知也成立。
  • 可视化结果表明,随着 ϵ 增大,鲁棒性边界变得更加保守,尤其由于 ReLU 线性近似性能下降,但在小扰动下仍保持紧密。
  • 与计算成本更高的鲁棒性方法比较显示,CARRL 在显著更低的推理成本下实现了相当的鲁棒性,验证了其高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。