[论文解读] Mitigation of Policy Manipulation Attacks on Deep Q-Networks with Parameter-Space Noise
本文提出在深度Q网络(DQNs)的训练过程中引入参数空间噪声,以在测试和训练阶段均缓解白盒和黑盒对抗性攻击。通过利用NoisyNet实现自适应的、噪声驱动的探索,该方法增强了策略的鲁棒性,并降低了对抗性样本的可迁移性,在Atari环境中相比标准DQN表现出显著提升的抗干扰能力。
Recent developments have established the vulnerability of deep reinforcement learning to policy manipulation attacks via intentionally perturbed inputs, known as adversarial examples. In this work, we propose a technique for mitigation of such attacks based on addition of noise to the parameter space of deep reinforcement learners during training. We experimentally verify the effect of parameter-space noise in reducing the transferability of adversarial examples, and demonstrate the promising performance of this technique in mitigating the impact of whitebox and blackbox attacks at both test and training times.
研究动机与目标
- 为应对深度强化学习智能体因对抗性样本导致的策略操控日益严重的脆弱性问题。
- 探究参数空间噪声是否能够增强对测试阶段和训练阶段对抗性攻击的鲁棒性。
- 开发并验证一种基于NoisyNet自适应参数噪声的缓解技术,以提升泛化能力和鲁棒性。
- 提供一个开源平台,支持在深度强化学习中对抗性攻击的可复现实验。
- 通过实证评估,在参数噪声下对抗性样本的可迁移性降低程度。
提出的方法
- 在DQN训练过程中使用NoisyNet引入自适应的参数空间噪声,替代传统的$ε$-greedy探索方法。
- 利用NoisyNet架构,通过参数噪声迭代扰动网络权重(例如全连接层),提升探索能力和策略多样性。
- 使用FGSM方法生成对抗性样本,扰动上限为$\lambda = 1.0/255.0$,用于测试阶段和训练阶段的攻击。
- 在三个Atari 2600游戏(Enduro、Assault和Blackout)中,对比标准DQN与NoisyNet-DQN在相同攻击条件下的性能表现。
- 通过在测试和训练阶段遭受对抗性扰动时的累积奖励衰减程度,衡量模型的鲁棒性。
- 使用TensorFlow实现实验平台,利用OpenAI Gym进行环境模拟,使用Cleverhans生成对抗性样本。
实验结果
研究问题
- RQ1在黑盒攻击场景下,DQNs中的参数空间噪声是否能降低对抗性样本的可迁移性?
- RQ2基于NoisyNet的训练是否能提升对测试阶段白盒对抗性攻击的鲁棒性?
- RQ3参数噪声如何影响DQNs对训练阶段策略诱导攻击的敏感性?
- RQ4参数噪声在多大程度上增强了深度强化学习智能体的泛化能力和鲁棒性?
- RQ5参数噪声是否可在无需对抗性微调的情况下作为有效的防御机制?
主要发现
- 在所有三个Atari环境中,NoisyNet-DQN在白盒测试阶段攻击下的性能下降显著低于标准DQN。
- 在黑盒测试阶段攻击中,NoisyNet表现出更强的鲁棒性,性能下降程度显著低于标准DQN,表明对抗性样本的可迁移性降低。
- 在训练阶段攻击中,标准DQN模型持续遭受严重性能下降,而NoisyNet-DQN保持了稳定的训练过程,尤其在Assault环境中,性能几乎未受影响。
- NoisyNet中的自适应参数噪声通过引入随机性,破坏了精心构造的对抗性样本的可迁移性,从而降低了其有效性。
- 结果证实,参数空间噪声能够增强策略的泛化能力和鲁棒性,使其成为应对白盒和黑盒攻击的有前景的防御机制。
- 已开发并发布一个开源平台,以支持深度强化学习中对抗性鲁棒性研究的可复现性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。