Skip to main content
QUICK REVIEW

[论文解读] Online Robustness Training for Deep Reinforcement Learning

M. L. Fischer, Matthew Mirman|arXiv (Cornell University)|Nov 3, 2019
Adversarial Robustness in Machine Learning参考文献 44被引用 12
一句话总结

该论文提出RS-DQN,一种新颖的深度强化学习框架,通过将Q网络训练与策略网络(学生)训练解耦,实现在线鲁棒性训练。通过将Q值蒸馏到学生网络中,RS-DQN整合了最先进的对抗性训练与可证明鲁棒性训练方法,在保持与标准DQN相当性能的同时,实现了对基于梯度的攻击(如PGD)在Atari游戏上的强鲁棒性。

ABSTRACT

In deep reinforcement learning (RL), adversarial attacks can trick an agent into unwanted states and disrupt training. We propose a system called Robust Student-DQN (RS-DQN), which permits online robustness training alongside Q networks, while preserving competitive performance. We show that RS-DQN can be combined with (i) state-of-the-art adversarial training and (ii) provably robust training to obtain an agent that is resilient to strong attacks during training and evaluation.

研究动机与目标

  • 解决深度强化学习智能体在输入状态受梯度对抗性扰动时性能下降的脆弱性问题。
  • 使先前用于监督学习的先进鲁棒性训练技术能够集成到深度强化学习训练流程中。
  • 在干净(非攻击)条件下保持竞争力性能的同时,显著提升在对抗性扰动下的鲁棒性。
  • 通过符号化鲁棒性训练方法,在Atari环境中证明对像素级扰动(如±1像素)的可证明鲁棒性。
  • 设计一种训练框架,使策略网络的防御性训练不会损害Q网络的性能或学习动态。

提出的方法

  • 将标准DQN分解为Q网络(用于价值估计)和学生策略网络(用于动作选择),从而实现策略网络的独立鲁棒性目标训练。
  • 使用知识蒸馏将Q网络的Q值预测传递给学生网络,确保学生网络学习到最优策略。
  • 对学生成用PGD生成的对抗性状态进行对抗性训练,以最小化选择最优动作的概率。
  • 通过符号区间分析(使用DiffAI)实现可证明鲁棒性训练,保证在每个状态周围有界扰动区域内正确选择动作。
  • 在训练过程中逐步降低鲁棒性损失权重和扰动半径,以平衡准确率与鲁棒性。
  • 保持Q网络的标准DQN训练,同时使用学生网络进行探索与动作选择,从而保持训练稳定性。

实验结果

研究问题

  • RQ1监督学习中先进的对抗性训练方法能否有效迁移至深度强化学习,以实现鲁棒策略学习?
  • RQ2可证明鲁棒性训练能否集成到DQN框架中,以保证在强化学习环境中对有界输入扰动的鲁棒性?
  • RQ3将策略学习与价值网络训练解耦,是否能在不损害Q网络性能的前提下实现鲁棒训练?
  • RQ4DQN智能体在保持干净条件下性能的同时,能在多大程度上实现对抗攻击下的强鲁棒性?
  • RQ5在Atari游戏中,智能体动作保持可证明正确的最大扰动半径(以像素强度计)是多少?

主要发现

  • 在干净评估条件下,RS-DQN的性能与标准DQN相当,平均得分分别为Freeway(32.53)、Bank Heist(154.00)和Boxing(90.47),略低于DQN的33.00、222.00和95.87。
  • 在PGD攻击(k=4)下,DQN性能崩溃(如Pong中仅得5.13分),而RS-DQN保持鲁棒性,Pong中得分为5.13,Boxing中得分为90.47。
  • 通过可证明鲁棒性训练,RS-DQN实现了最小可证明鲁棒性半径ε_max = 2.028(乘以255),意味着在Freeway中对±1像素变化具有可证明确保的鲁棒性。
  • 在Bank Heist中,RS-DQN实现ε_max = 1.373,表明其对±1像素扰动具有保证动作正确性的鲁棒性。
  • 可证明鲁棒的RS-DQN智能体在性能上与DQN存在显著差距(Bank Heist中154.00 vs. 222.00),但考虑到其强大的鲁棒性保证,该权衡是可接受的。
  • 该方法成功实现了在线鲁棒性训练,且未损害Q网络的学习性能,表现为所有测试的Atari环境中训练与评估曲线均保持稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。