Skip to main content
QUICK REVIEW

[论文解读] Robust Deep Reinforcement Learning through Adversarial Loss

Tuomas Oikarinen, Tsui-Wei Weng|arXiv (Cornell University)|Aug 5, 2020
Adversarial Robustness in Machine Learning参考文献 43被引用 15
一句话总结

该论文提出RADIAL-RL,一种通过从鲁棒性验证边界导出的对抗性损失函数来提升对抗鲁棒性的鲁棒深度强化学习框架。该方法使DQN、A3C和PPO智能体能够抵抗比以往方法强至5倍的扰动,同时训练效率提高2–10倍,并引入了一种新的评估指标Greedy Worst-Case Reward (GWC),可高效代理最坏情况下的性能表现。

ABSTRACT

Recent studies have shown that deep reinforcement learning agents are vulnerable to small adversarial perturbations on the agent's inputs, which raises concerns about deploying such agents in the real world. To address this issue, we propose RADIAL-RL, a principled framework to train reinforcement learning agents with improved robustness against $l_p$-norm bounded adversarial attacks. Our framework is compatible with popular deep reinforcement learning algorithms and we demonstrate its performance with deep Q-learning, A3C and PPO. We experiment on three deep RL benchmarks (Atari, MuJoCo and ProcGen) to show the effectiveness of our robust training algorithm. Our RADIAL-RL agents consistently outperform prior methods when tested against attacks of varying strength and are more computationally efficient to train. In addition, we propose a new evaluation method called Greedy Worst-Case Reward (GWC) to measure attack agnostic robustness of deep RL agents. We show that GWC can be evaluated efficiently and is a good estimate of the reward under the worst possible sequence of adversarial attacks. All code used for our experiments is available at https://github.com/tuomaso/radial_rl_v2.

研究动机与目标

  • 解决深度强化学习智能体在观测空间中对微小、难以察觉的对抗性扰动的脆弱性问题。
  • 开发一种可泛化、高效的防御框架,兼容DQN、A3C和PPO等主流深度强化学习算法。
  • 在不牺牲干净环境下的样本效率或性能的前提下,提升对ℓp-范数有界对抗攻击的鲁棒性。
  • 提出一种新的评估指标Greedy Worst-Case Reward (GWC),可在线性时间内高效估计对抗输入扰动下的最坏情况性能。
  • 证明鲁棒训练能增强智能体在未见环境(如ProcGen基准)中的泛化能力。

提出的方法

  • 将鲁棒性验证边界整合到损失函数中,以训练能够抵御ℓp-范数有界对抗扰动的智能体。
  • 利用最坏情况动作序列的可微分近似,在训练过程中计算对抗性损失,实现端到端优化。
  • 通过双层优化过程计算对抗性损失,模拟ε边界内可能的最强扰动。
  • 该方法与标准深度强化学习算法兼容,仅需极少的架构修改即可应用。
  • 提出一种新的评估指标Greedy Worst-Case Reward (GWC),可在线性时间内估计最坏情况性能,避免指数级复杂度。
  • 通过借鉴[28]中的现有技术,将框架扩展以处理语义扰动(如亮度、色彩变化),从而提升其在现实世界中的广泛适用性。

实验结果

研究问题

  • RQ1基于鲁棒性验证边界的对抗性损失是否能显著提升深度强化学习智能体对ℓp-范数有界攻击的鲁棒性?
  • RQ2与先前的SOTA方法(如SA-PPO)相比,所提出的RADIAL-RL框架在训练效率和鲁棒性方面表现如何?
  • RQ3鲁棒训练在多大程度上提升了智能体在ProcGen基准中对未见环境的泛化能力?
  • RQ4Greedy Worst-Case Reward (GWC) 是否能作为对抗扰动下真实最坏情况奖励的准确且高效代理?
  • RQ5该框架在多种强化学习基准测试中是否依然有效,包括离散控制(Atari)、连续控制(MuJoCo)和程序化生成(ProcGen)?

主要发现

  • RADIAL-RL智能体相比先前方法,能抵抗比现有SOTA方法强至5倍的对抗性扰动。
  • 与SA-PPO相比,该框架将训练时间减少了2–10倍,在显著提升计算效率的同时实现了更优的鲁棒性。
  • 在MuJoCo环境中,RADIAL-PPO在Half-Cheetah环境(ε=0.15)下实现了4724.3 ± 10.6的平均回报,优于SA-PPO在相同攻击强度下的4175.0 ± 29.9。
  • 在ProcGen基准中,RADIAL智能体在ε=5/255 PGD攻击下仍能获得高回报,展现出对未见关卡的强大泛化能力。
  • 在ε ∈ {1.3,1.4}时,Greedy Worst-Case Reward (GWC) 在40个episode中的37个与真实Absolute Worst-Case Reward (AWC) 非常接近;在ε ∈ {1.0,1.2}时完全匹配,验证了其作为代理指标的有效性。
  • 与先前工作的动作认证率(ACR)相比,GWC与AWC的相关性更强,证实其作为鲁棒性评估指标的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。