[论文解读] Analysis and Improvement of Adversarial Training in DQN Agents With Adversarially-Guided Exploration (AGE)
本文提出对抗引导探索(Adversarially-Guided Exploration, AGE),一种针对DQN智能体的样本高效探索方法,通过将对抗性扰动整合到探索过程中,结合$\epsilon$-greedy与Boltzmann探索的混合策略,提升对抗鲁棒性。AGE在对抗性训练中实现更快收敛,并对状态空间攻击表现出更强的鲁棒性,显著降低样本复杂度。
This paper investigates the effectiveness of adversarial training in enhancing the robustness of Deep Q-Network (DQN) policies to state-space perturbations. We first present a formal analysis of adversarial training in DQN agents and its performance with respect to the proportion of adversarial perturbations to nominal observations used for training. Next, we consider the sample-inefficiency of current adversarial training techniques, and propose a novel Adversarially-Guided Exploration (AGE) mechanism based on a modified hybrid of the $ε$-greedy algorithm and Boltzmann exploration. We verify the feasibility of this exploration mechanism through experimental evaluation of its performance in comparison with the traditional decaying $ε$-greedy and parameter-space noise exploration algorithms.
研究动机与目标
- 分析对抗性训练在DQN智能体中,基于对抗性经验比例的理论极限。
- 识别当前DQN中对抗性训练技术的样本低效性。
- 开发一种新型探索机制,以提升对抗性训练期间的样本效率。
- 评估所提出的对抗引导探索(AGE)机制在增强策略鲁棒性方面的有效性。
- 将AGE与传统的$\epsilon$-greedy及参数空间噪声探索在对抗鲁棒性方面进行对比。
提出的方法
- 提出AGE,一种结合$\epsilon$-greedy与Boltzmann探索的混合探索策略,引导探索向对抗性状态集中。
- 引入一种改进的$\epsilon$-greedy策略,其中探索动作从分布$\zeta_{\text{adv}}^{\pi_i}$中选取,该分布优先选择经对抗扰动的状态。
- 使用概率预算$P(\text{attack})$限制攻击者的扰动能力,区分状态中性攻击者与目标攻击者。
- 采用具有优先采样的经验回放机制,要求随时间推移,采样常规经验的概率逐渐增加,以减少TD误差中的偏差。
- 推导出对抗性训练保持有效的理论条件,要求$ p_{\text{nominal}}(s_t) > p(\text{attack}) $以实现收敛。
- 采用基于DQN的对抗性智能体,固定扰动成本$c_{\text{adv}} = 1$,以测量训练过程中的鲁棒性与遗憾。
实验结果
研究问题
- RQ1基于经验回放缓冲区中对抗性经验的比例,DQN智能体的对抗性训练理论极限是什么?
- RQ2对抗性经验与常规经验的比例如何影响DQN策略的收敛性与鲁棒性?
- RQ3混合探索机制能否提升DQN智能体在对抗性训练中的样本效率?
- RQ4AGE在对抗鲁棒性与训练稳定性方面,相较于传统的$\epsilon$-greedy与参数空间噪声探索表现如何?
- RQ5与标准对抗性训练相比,AGE是否能实现更快收敛与更高鲁棒性?
主要发现
- 当$ p(\text{attack}) = 0.2 $与$ 0.4 $时,对抗性训练在攻击启动后能快速恢复;但当$ p(\text{attack}) = 0.8 $与$ 1.0 $时,恢复失败于训练周期内。
- 理论分析表明,有效的对抗性训练要求随时间推移,采样常规经验的概率必须增加,即$ p_{\text{nominal}}(s_t) > p(\text{attack}) $。
- 如图3所示,AGE训练的策略相比$\epsilon$-greedy探索展现出更快的收敛速度与更高的训练稳定性。
- 针对AGE训练策略的对抗性智能体在100,000次迭代内无法收敛,而针对$\epsilon$-greedy策略的同一智能体在约90,000步时已实现收敛。
- AGE训练在相同训练时间内,相比标准对抗性训练,实现更优的对抗鲁棒性,表现为更低的遗憾与更高的扰动次数,样本效率显著提升。
- 在对抗鲁棒性基准测试中,AGE优于$\epsilon$-greedy与参数空间噪声探索,展现出更高的样本效率与更强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。