[论文解读] Adversarial Exploitation of Policy Imitation
本文展示了通过模仿学习,利用从演示中学习深度Q网络(DQfD)从被动观测中复制策略,深度强化学习(DRL)策略易受模型提取攻击。关键贡献在于成功将对抗性样本从模仿策略转移到原始DRL智能体,实现高成功率的黑盒攻击,尤其在拥有更多专家演示时效果更显著。
This paper investigates a class of attacks targeting the confidentiality aspect of security in Deep Reinforcement Learning (DRL) policies. Recent research have established the vulnerability of supervised machine learning models (e.g., classifiers) to model extraction attacks. Such attacks leverage the loosely-restricted ability of the attacker to iteratively query the model for labels, thereby allowing for the forging of a labeled dataset which can be used to train a replica of the original model. In this work, we demonstrate the feasibility of exploiting imitation learning techniques in launching model extraction attacks on DRL agents. Furthermore, we develop proof-of-concept attacks that leverage such techniques for black-box attacks against the integrity of DRL policies. We also present a discussion on potential solution concepts for mitigation techniques.
研究动机与目标
- 探究仅使用模仿学习技术对DRL策略实施模型提取攻击的可行性。
- 开发概念验证型黑盒攻击,利用策略模仿实现完整性破坏。
- 评估从模仿策略到原始DRL智能体的对抗性样本可转移性。
- 提出一种通过约束策略随机化(CRoP)缓解策略模仿攻击的解决方案概念。
提出的方法
- 利用从演示中学习的深度Q网络(DQfD)仅基于目标DRL智能体状态-动作行为的被动观测,训练一个代理策略。
- 采用混合损失函数,结合一步双Q学习、监督大间隔分类、n步回报和L2正则化,以提高模仿准确性。
- 使用FGSM方法,设置$\epsilon = 0.01$,在模仿策略上生成对抗性样本,随后测试其对原始策略的可转移性。
- 应用约束随机化机制(CRoP),仅允许后悔值在可容忍阈值$\Omega_{\text{max}}$范围内的动作被选择。
- 在经验回放缓冲区中永久保留专家演示数据,以在训练期间保持模仿保真度。
- 在模仿阶段采用优先经验回放和目标网络更新,以稳定训练。
实验结果
研究问题
- RQ1是否可以仅通过被动观测DRL策略的行为,有效逆向工程其策略?
- RQ2在模仿策略上生成的对抗性样本在多大程度上能成功攻击原始DRL策略?
- RQ3专家演示的数量如何影响模仿策略与原始策略之间对抗性样本的可转移性?
- RQ4通过约束策略随机化在不牺牲性能的前提下,缓解策略模仿攻击是否可行?
主要发现
- 在模仿策略上生成的对抗性样本可成功转移到原始DRL策略,证明存在可行的黑盒攻击向量。
- DQN-5k的每集平均成功转移次数达到175.11,PPO2-5k达到173.94,表明在拥有足够演示时可转移性极高。
- 随着演示数量减少,转移成功率显著下降,DQN-1k降至3.30,表明演示数量与攻击有效性之间存在强烈相关性。
- 随着专家数据增多,模仿策略与原始策略之间的分布差距缩小,对抗性样本的可转移性随之提升。
- 所提出的约束策略随机化(CRoP)框架提供了一种有原则的防御机制,通过限制动作选择,在保持性能的同时降低模仿风险。
- 结果证实,策略模仿攻击不仅可行,而且非常有效,尤其当攻击者可访问中等数量的专家演示时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。