Skip to main content
QUICK REVIEW

[论文解读] Efficient Adversarial Training without Attacking: Worst-Case-Aware Robust Reinforcement Learning

Yongyuan Liang, Yanchao Sun|arXiv (Cornell University)|Oct 12, 2022
Adversarial Robustness in Machine Learning被引用 8
一句话总结

该论文提出 WocaR-RL,一种新颖的鲁棒强化学习框架,通过直接估计并优化在有界 ℓp 攻击下的最坏情况奖励,无需单独训练攻击者,从而高效提升对抗鲁棒性。该方法在训练时间与样本量仅为先前方法 50% 的情况下,实现了最先进(SOTA)的鲁棒性能,同时在 Walker2d 等环境中学习到更具可解释性的鲁棒行为。

ABSTRACT

Recent studies reveal that a well-trained deep reinforcement learning (RL) policy can be particularly vulnerable to adversarial perturbations on input observations. Therefore, it is crucial to train RL agents that are robust against any attacks with a bounded budget. Existing robust training methods in deep RL either treat correlated steps separately, ignoring the robustness of long-term rewards, or train the agents and RL-based attacker together, doubling the computational burden and sample complexity of the training process. In this work, we propose a strong and efficient robust training framework for RL, named Worst-case-aware Robust RL (WocaR-RL) that directly estimates and optimizes the worst-case reward of a policy under bounded l_p attacks without requiring extra samples for learning an attacker. Experiments on multiple environments show that WocaR-RL achieves state-of-the-art performance under various strong attacks, and obtains significantly higher training efficiency than prior state-of-the-art robust training methods. The code of this work is available at https://github.com/umd-huang-lab/WocaR-RL.

研究动机与目标

  • 解决深度强化学习策略在现实应用中对对抗扰动的脆弱性问题。
  • 通过刻画在有界攻击下的最坏情况奖励脆弱性,而非依赖独立的攻击者训练,提升长期鲁棒性。
  • 开发一种高效训练框架,避免现有对抗训练方法中样本与计算成本翻倍的问题。
  • 实现内在上对攻击更不敏感的鲁棒策略,而不仅限于对小扰动的鲁棒性。
  • 为现有 DRL 算法(如 PPO 和 DQN)提供即插即用的增强方案。

提出的方法

  • 提出一种新颖的最坏攻击贝尔曼算子,利用现有离策略样本估计策略价值的下界,从而无需通过环境交互来学习攻击者。
  • 通过优化策略以最大化自然回报与最坏情况预期回报的加权组合,平衡无攻击与对抗扰动下的性能表现。
  • 引入状态重要性权重 w(s),突出那些微小扰动即导致奖励显著下降的状态,提升关键决策区域的鲁棒性。
  • 对策略网络施加正则化损失 Lreg,以增强其对状态扰动的内在鲁棒性,尤其在高影响状态中表现更优。
  • 利用离策略回放缓冲区估计最坏情况价值,无需额外的环境滚动,实现高效训练。
  • 可无缝集成至标准 DRL 算法(如 PPO 和 DQN)中,增强其鲁棒性,且无需修改核心架构。

实验结果

研究问题

  • RQ1我们能否在不训练独立的基于 RL 的攻击者的情况下,估计在有界 ℓp 攻击下策略的最坏情况价值?
  • RQ2如何通过直接优化最坏情况性能,提升 DRL 智能体的长期鲁棒性?
  • RQ3与使用训练好的攻击者的对抗训练相比,引入状态重要性加权与正则化是否能更有效地提升鲁棒性?
  • RQ4我们能否在显著减少样本与计算成本的前提下,实现相比现有方法的 SOTA 鲁棒性能?
  • RQ5在复杂环境中,自然性能与鲁棒性之间的权衡如何影响策略行为?

主要发现

  • 在最强攻击下,WocaR-RL 在 Walker2d 环境中实现的最坏情况奖励比 PA-ATLA-PPO 高 20%,且仅使用其 50% 的训练样本与 50% 的训练时间。
  • 定性分析表明,WocaR-RL 在 Walker2d 环境中学习到的行为更具可解释性与鲁棒性,优于 PA-ATLA-PPO。
  • 消融实验验证,状态重要性权重 w(s) 与正则化损失 Lreg 均显著提升鲁棒性,其中 w(s) 在所有 MuJoCo 环境中均有效提升性能。
  • 权衡超参数 κwst 有效控制自然性能与鲁棒性之间的平衡,κwst 越高,最坏情况性能越好,但自然性能相应降低。
  • 在 Hopper、Walker2d、Halfcheetah 与 Ant 环境中,WocaR-RL 在最坏情况鲁棒性方面全面优于所有基线方法,同时保持相近的自然性能。
  • 该框架具有普适性,可无需修改核心架构地用于增强现有 DRL 算法(如 PPO 与 DQN)的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。