[论文解读] Vulnerability-Aware Poisoning Mechanism for Online RL with Unknown Dynamics
本文提出VA2C-P,一种针对在线深度强化学习的漏洞感知中毒攻击方法,可在不事先了解环境动态的情况下运行。通过引入一种新颖的稳定性半径度量来量化算法的脆弱性,VA2C-P 实时战略性地污染轨迹,成功阻止智能体学习最优策略,或在有限攻击预算下将其引导至目标策略。
Poisoning attacks on Reinforcement Learning (RL) systems could take advantage of RL algorithm's vulnerabilities and cause failure of the learning. However, prior works on poisoning RL usually either unrealistically assume the attacker knows the underlying Markov Decision Process (MDP), or directly apply the poisoning methods in supervised learning to RL. In this work, we build a generic poisoning framework for online RL via a comprehensive investigation of heterogeneous poisoning models in RL. Without any prior knowledge of the MDP, we propose a strategic poisoning algorithm called Vulnerability-Aware Adversarial Critic Poison (VA2C-P), which works for most policy-based deep RL agents, closing the gap that no poisoning method exists for policy-based RL agents. VA2C-P uses a novel metric, stability radius in RL, that measures the vulnerability of RL algorithms. Experiments on multiple deep RL agents and multiple environments show that our poisoning algorithm successfully prevents agents from learning a good policy or teaches the agents to converge to a target policy, with a limited attacking budget.
研究动机与目标
- 解决在攻击者缺乏环境动态知识时,对在线策略深度强化学习智能体进行中毒攻击的关键空白。
- 克服在线强化学习中毒攻击的挑战,包括未来数据不可用、数据非独立同分布以及环境动态未知等问题。
- 开发一种适用于基于策略梯度的深度强化学习智能体(如A2C、PPO和VPG)的实用、实时中毒框架。
- 提出一种新度量——稳定性半径,用于量化并比较不同强化学习算法对中毒攻击的脆弱性。
- 在受限攻击预算下,于多样化环境和最先进强化学习算法中验证所提方法的有效性。
提出的方法
- 提出一种名为稳定性半径的新度量,通过量化策略在状态空间中受微小扰动影响的容易程度,来衡量强化学习算法的脆弱性。
- 设计VA2C-P,一种基于稳定性半径实时指导选择最优扰动位置的战略性中毒算法,用于在线训练过程中。
- 在白盒设置下运行,攻击者可观察智能体的当前策略,并在每次交互后向下一状态注入扰动。
- 应用快速梯度符号法(FGSM)在下一状态上生成对抗性扰动,其大小和方向由稳定性半径引导,以最大化策略干扰。
- 将框架扩展至如SAC等离策略学习者,通过操纵回放缓冲区或采样小批量数据,证明其广泛适用性。
- 仅使用智能体自身的经验轨迹作为环境模型估计的唯一来源,避免直接与环境交互或事先掌握MDP知识。
实验结果
研究问题
- RQ1当攻击者缺乏对环境动态的先验知识时,能否有效设计针对在线策略深度强化学习智能体的中毒攻击?
- RQ2如何定量测量并比较不同强化学习算法的脆弱性,以反映其对中毒攻击的敏感程度?
- RQ3非独立同分布的数据和未来数据不可用对有效在线强化学习中毒攻击设计有何影响?
- RQ4能否设计一种实时中毒策略,仅依赖智能体的当前经验,而无需访问未来轨迹?
- RQ5在多样化强化学习环境和算法中,中毒攻击在目标导向和非目标导向设置下对学习过程的破坏程度如何?
主要发现
- 在CartPole环境中,VA2C-P成功阻止A2C和PPO智能体学习稳定策略,当攻击预算为C/K=1.0时,平均每集奖励从约180降至50以下。
- 在Hopper环境中,VA2C-P在相同预算下将A2C智能体的平均每集奖励从约300降至100以下,证明其在连续控制任务中的有效性。
- 在目标导向中毒攻击中,当ϵ=0.05时,VA2C-P在500集内使CartPole中目标动作的比例超过80%,显著优于基于FGSM的基线方法。
- 在HalfCheetah环境中,VA2C-P在1000集后将A2C智能体的累积奖励从约500降至100以下,显示出在复杂运动任务中的鲁棒性。
- 即使在黑盒设置下,VA2C-P仍保持强效性能,当攻击者仅观察智能体行为而无完整策略访问权限时亦然。
- 通过SAC扩展至离策略强化学习表明,VA2C-P可通过操纵回放缓冲区显著降低学习性能,证实其在在线策略智能体之外的广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。