[论文解读] Robust Deep Reinforcement Learning through Bootstrapped Opportunistic Curriculum
本文提出了一种新型对抗性课程学习框架——自举机会式课程学习(BCL),通过在每个课程阶段使用多个先前训练运行中表现最佳的模型进行自举初始化,并在模型已具备鲁棒性时机会性地跳过至更高扰动水平,从而提升深度强化学习的鲁棒性。BCL 实现了最先进的鲁棒性,使策略在 Pong 环境中可抵御高达 ε=25/255 的对抗性扰动——显著优于先前方法在 ε=5/255 以上即失效的表现。
Despite considerable advances in deep reinforcement learning, it has been shown to be highly vulnerable to adversarial perturbations to state observations. Recent efforts that have attempted to improve adversarial robustness of reinforcement learning can nevertheless tolerate only very small perturbations, and remain fragile as perturbation size increases. We propose Bootstrapped Opportunistic Adversarial Curriculum Learning (BCL), a novel flexible adversarial curriculum learning framework for robust reinforcement learning. Our framework combines two ideas: conservatively bootstrapping each curriculum phase with highest quality solutions obtained from multiple runs of the previous phase, and opportunistically skipping forward in the curriculum. In our experiments we show that the proposed BCL framework enables dramatic improvements in robustness of learned policies to adversarial perturbations. The greatest improvement is for Pong, where our framework yields robustness to perturbations of up to 25/255; in contrast, the best existing approach can only tolerate adversarial noise up to 5/255. Our code is available at: https://github.com/jlwu002/BCL.
研究动机与目标
- 解决深度强化学习(DRL)策略在状态观测中对微小对抗性扰动的严重脆弱性问题。
- 克服现有对抗性训练和简单课程方法的局限性,这些方法无法将鲁棒性扩展至更大扰动。
- 开发一种灵活、自适应的课程框架,在不牺牲正常性能的前提下提升鲁棒性。
- 通过结构化的、分阶段的课程推进,使 DRL 代理在日益严重的对抗性攻击下具备泛化能力。
提出的方法
- 该框架采用自举课程阶段,即从上一阶段多个对抗性训练运行中表现最佳的模型中选取作为下一阶段的起点。
- 引入机会性跳过机制,若当前模型对更高扰动水平(ε)表现出鲁棒性,则可提前推进课程至更高 ε 水平。
- 通过结合区间边界传播与基于 FGSM 的攻击,生成对抗性样本,以指导课程的推进。
- 课程被设计为逐步增加对抗性扰动的幅度,从较小的 ε 开始,仅在确认鲁棒性后才推进至更高水平。
- 每个阶段进行多次训练运行,以确保高质量的初始化并降低模型性能的方差。
- 该方法在 Atari 环境(Pong、Freeway、BankHeist、RoadRunner)上进行评估,采用 DQN 风格架构,对正常奖励的影响极小。
实验结果
研究问题
- RQ1与标准对抗性训练相比,课程学习框架是否能显著提升 DRL 策略对更大对抗性扰动的鲁棒性?
- RQ2通过使用多个运行中表现最佳的模型自举每个课程阶段,是否能增强鲁棒性与训练稳定性?
- RQ3是否可以通过机会性地跳过课程阶段来加速训练,同时保持或提升鲁棒性?
- RQ4在对抗扰动幅度逐渐增大的情况下,所提出的 BCL 框架与最先进方法(如 RADIAL-DQN 和 SA-DQN)相比,鲁棒性表现如何?
- RQ5在多种 Atari 环境中,BCL 框架在实现卓越鲁棒性的同时,能否保持高水平的正常性能?
主要发现
- 在 Pong 中,BCL 训练的策略在对抗性扰动高达 ε=25/255 时仍能保持鲁棒性能,相比先前最先进方法(RADIAL-DQN)在 ε=5/255 时即失效,实现显著提升。
- 在 BankHeist 中,BCL 在 ε=15/255 时的鲁棒性较 SA-DQN 提升了一个数量级,展现出更强的对抗攻击下泛化能力。
- 在 RoadRunner 中,BCL 在 ε=15/255 时相比 RADIAL-DQN 提升了数个数量级,表明在鲁棒策略学习方面取得显著进展。
- BCL 框架在所有环境中均保持了强劲的正常性能,与标准 DQN 训练相比,性能下降可忽略不计。
- 机会性跳过机制通过避免不必要的阶段减少了训练时间,而自举初始化则确保了各次运行间的一致性能提升。
- 该方法在多次运行和多种环境中均表现出一致的改进,鲁棒性指标方差极低,表明其具有高度可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。