[论文解读] Defending Adversarial Attacks without Adversarial Attacks in Deep Reinforcement Learning.
本文提出了一种名为鲁棒策略蒸馏(Robust Policy Distillation)的新颖蒸馏方法,可在学生策略训练过程中无需使用对抗性样本的情况下,提升深度强化学习中的对抗鲁棒性。通过结合处方间隙最大化与雅可比正则化损失,该方法在五个Atari游戏中实现了最先进(SOTA)的鲁棒性表现,既具备理论保证,又在实证上优于现有方法。
Many recent studies in deep reinforcement learning (DRL) have proposed to boost adversarial robustness through policy distillation utilizing adversarial training, where additional adversarial examples are added in the training process of the student policy; this makes the robustness improvement less flexible and more computationally expensive. In contrast, we propose an efficient policy distillation paradigm called robust policy distillation that is capable of achieving an adversarially robust student policy without relying on any adversarial example during student policy training. To this end, we devise a new policy distillation loss that consists of two terms: 1) a prescription gap maximization loss aiming at simultaneously maximizing the likelihood of the action selected by the teacher policy and the entropy over the remaining actions; 2) a Jacobian regularization loss that minimizes the magnitude of Jacobian with respect to the input state. The theoretical analysis proves that our distillation loss guarantees to increase the prescription gap and the adversarial robustness. Meanwhile, experiments on five Atari games firmly verifies the superiority of our policy distillation on boosting adversarial robustness compared to other state-of-the-arts.
研究动机与目标
- 解决现有基于对抗性训练的蒸馏方法在深度强化学习中计算效率低下且灵活性不足的问题。
- 克服学生策略训练期间对对抗性样本的依赖,该依赖限制了灵活性并增加了训练成本。
- 开发一种蒸馏框架,通过内在损失设计实现对抗鲁棒性,而非依赖对抗性样本的数据增强。
- 理论上证明通过新损失函数最大化处方间隙并最小化输入敏感性,可提升鲁棒性。
- 在标准深度强化学习基准测试中,特别是在五个Atari游戏中,验证所提方法在对抗攻击下的实证优越性。
提出的方法
- 提出一种结合两部分的新策略蒸馏损失:处方间隙最大化与雅可比正则化。
- 设计处方间隙最大化损失,以提升教师策略动作的概率,同时促进其他动作的熵,从而增强对输入扰动的鲁棒性。
- 引入雅可比正则化损失,以最小化策略关于输入状态的雅可比矩阵的范数,降低对微小输入变化的敏感性。
- 理论分析证明,联合损失函数可增大处方间隙,并在有界扰动下提升对抗鲁棒性。
- 使用干净数据训练学生策略,训练过程中完全避免使用任何对抗性样本,同时仍实现鲁棒性能。
- 该方法仅依赖教师的行为和梯度信息,无需生成对抗性数据,因此高效且可扩展。
实验结果
研究问题
- RQ1是否可以在学生策略训练过程中不使用对抗性样本,实现深度强化学习中的对抗鲁棒性?
- RQ2一种同时最大化处方间隙并正则化策略雅可比矩阵的蒸馏损失,是否能提升对对抗攻击的鲁棒性?
- RQ3与最先进(SOTA)的对抗性训练和蒸馏方法相比,该方法在鲁棒性和训练效率方面表现如何?
- RQ4所提损失函数在对抗鲁棒性和处方间隙最大化方面提供了哪些理论保证?
- RQ5该方法能否在多样环境中泛化,如在一组多样化的Atari游戏中所展示的那样?
主要发现
- 所提出的鲁棒策略蒸馏方法在五个Atari游戏中实现了最先进(SOTA)的对抗鲁棒性,且在学生训练过程中未使用任何对抗性样本。
- 通过在对抗攻击下的全面评估,验证了该方法相较于现有SOTA方法在鲁棒性方面有显著提升。
- 理论分析确认,所提损失函数通过雅可比正则化最小化输入敏感性,可增大处方间隙并增强对抗鲁棒性。
- 该方法在干净环境上保持高性能,同时显著提升鲁棒性,表明标准性能与鲁棒性之间无权衡。
- 实验表明,蒸馏过程高效且可扩展,避免了训练期间生成对抗性样本的计算负担。
- 消融研究证实,损失函数的两个组成部分——处方间隙最大化与雅可比正则化——对实现鲁棒性能均不可或缺。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。