[论文解读] Reward Poisoning in Reinforcement Learning: Attacks Against Unknown Learners in Unknown Environments
本文提出U2,一种新型的黑盒奖励中毒攻击方法,适用于强化学习场景,且无需事先了解环境或学习算法。尽管假设极少,U2仍通过利用无遗憾强化学习算法的探索行为,实现了接近白盒攻击的性能,证明了在最复杂的未知-未知场景下,有效的奖励中毒攻击依然可行。
We study black-box reward poisoning attacks against reinforcement learning (RL), in which an adversary aims to manipulate the rewards to mislead a sequence of RL agents with unknown algorithms to learn a nefarious policy in an environment unknown to the adversary a priori. That is, our attack makes minimum assumptions on the prior knowledge of the adversary: it has no initial knowledge of the environment or the learner, and neither does it observe the learner's internal mechanism except for its performed actions. We design a novel black-box attack, U2, that can provably achieve a near-matching performance to the state-of-the-art white-box attack, demonstrating the feasibility of reward poisoning even in the most challenging black-box setting.
研究动机与目标
- 研究在最真实且最具挑战性的场景下奖励中毒攻击的可行性——即攻击者对环境或强化学习智能体的学习算法一无所知。
- 设计一种在最小假设下运行的黑盒攻击策略,仅观察智能体的行为,而不了解其内部机制。
- 证明即使在无先验知识的情况下,攻击者仍可通过精心设计的奖励扰动,使强化学习智能体学习到有害策略。
- 开发一种新型的探索子程序,使无遗憾强化学习算法能够探索完整的状态-动作空间,这对有效部署攻击至关重要。
提出的方法
- 提出U2,一种仅需观察智能体行为、并假设智能体遵循无遗憾学习算法的黑盒奖励中毒攻击方法。
- 设计一种探索子程序,将任意无遗憾强化学习算法转化为无需奖励、任务无关的探索者,能够高效覆盖整个状态-动作空间。
- 采用双阶段攻击策略:第一阶段为自监督探索,用于收集所有状态-动作对的数据;第二阶段为目标化中毒,引导智能体学习期望策略。
- 利用概率浓度不等式和次优性分析,对攻击成本进行上界约束,确保其在最小假设下仍接近最优白盒攻击。
- 利用无遗憾学习算法固有的探索特性,使攻击者能够有效收集数据以实施高效中毒。
- 引入一种鲁棒性感知的成本函数,同时考虑奖励扰动和策略偏差,确保攻击隐蔽且有效。
实验结果
研究问题
- RQ1在完全不了解环境或强化学习智能体学习算法的前提下,是否仍能实现有效的奖励中毒攻击?
- RQ2攻击者如何利用无遗憾强化学习智能体的探索行为,在无先验知识的情况下收集足够数据以实施中毒攻击?
- RQ3当攻击者无法访问真实环境动态或智能体内部参数时,黑盒攻击在多大程度上可达到白盒攻击的性能?
- RQ4能否设计一种自监督探索子程序,以实现在未知环境中的有效奖励中毒?
- RQ5在最小假设下,此类攻击的成本和成功率可提供哪些理论保证?
主要发现
- 尽管攻击者对环境或学习算法一无所知,U2的攻击成本仍处于最优白盒攻击的常数倍范围内。
- 攻击成本受目标策略次优性的量级约束,表明该方法在目标策略与智能体行为不完全对齐时依然有效。
- 探索子程序成功实现了对完整状态-动作空间的覆盖,这对攻击成功至关重要,且对下游强化学习任务具有独立研究价值。
- 以至少 1−4p 的概率,攻击成本保持有界且接近最优,该结论通过浓度不等式和并集界(union bounds)得到证明。
- 即使攻击者未观测到真实环境动态或智能体内部策略,攻击仍保持有效,证明了在真实场景中黑盒奖励中毒的可行性。
- 理论分析证实,攻击者可在极简假设下实现接近最优的性能,挑战了以往认为有效攻击必须依赖白盒知识的假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。