[论文解读] Blackbox Attacks on Reinforcement Learning Agents Using Approximated Temporal Information
本文提出了一种新颖的强化学习(RL)智能体黑盒攻击方法,利用序列到序列模型从观察序列中预测未来动作,从而在不访问模型内部结构的情况下生成可迁移的对抗性扰动。关键贡献是一种‘定时炸弹’攻击,可在延迟动作后触发错误行为,展示了针对RL智能体的一类新型隐蔽、时间目标攻击,动作预测准确率超过80%。
Recent research on reinforcement learning (RL) has suggested that trained agents are vulnerable to maliciously crafted adversarial samples. In this work, we show how such samples can be generalised from White-box and Grey-box attacks to a strong Black-box case, where the attacker has no knowledge of the agents, their training parameters and their training methods. We use sequence-to-sequence models to predict a single action or a sequence of future actions that a trained agent will make. First, we show our approximation model, based on time-series information from the agent, consistently predicts RL agents' future actions with high accuracy in a Black-box setup on a wide range of games and RL algorithms. Second, we find that although adversarial samples are transferable from the target model to our RL agents, they often outperform random Gaussian noise only marginally. This highlights a serious methodological deficiency in previous work on such agents; random jamming should have been taken as the baseline for evaluation. Third, we propose a novel use for adversarial samplesin Black-box attacks of RL agents: they can be used to trigger a trained agent to misbehave after a specific time delay. This appears to be a genuinely new type of attack. It potentially enables an attacker to use devices controlled by RL agents as time bombs.
研究动机与目标
- 在不访问模型参数或训练细节的情况下,开发针对RL智能体的黑盒攻击方法。
- 探究是否可在完全黑盒设置下生成并迁移对抗性样本。
- 将对抗性攻击的效果与随机噪声干扰作为基线进行对比评估。
- 探索新型时间维度攻击面,如延迟错误行为等。
- 展示一类新型定时炸弹攻击,可在延迟后触发未来对抗性行为。
提出的方法
- 训练一个序列到序列(seq2seq)模型,仅基于目标RL智能体的观察序列,预测未来动作序列。
- 利用训练好的seq2seq模型,对当前观察施加对抗性扰动,以影响未来动作。
- 在攻击者对目标智能体的架构、超参数或训练过程一无所知的黑盒设置下应用扰动。
- 使用l∞范数约束(例如,ϵ = 0.3)控制扰动幅度,确保其不可察觉。
- 通过测量游戏得分下降幅度以及触发特定延迟动作的概率来评估攻击成功率。
- 将攻击性能与随机高斯噪声作为基线进行对比,以评估方法的稳健性。
实验结果
研究问题
- RQ1在完全黑盒设置下,即无法获取RL智能体内部信息时,是否能有效生成并迁移对抗性样本?
- RQ2对抗性攻击在降低RL智能体游戏得分方面的表现,与随机高斯噪声相比如何?
- RQ3是否可设计对抗性扰动,使目标RL智能体在特定延迟后产生错误行为?
- RQ4哪些因素会影响不同游戏和RL算法中定时炸弹攻击的成功率?
- RQ5seq2seq模型的动作预测能力是否足以支持在多种RL智能体上实现高精度黑盒攻击?
主要发现
- seq2seq模型在三种游戏(CartPole、Pong、Space Invaders)和三种不同RL算法(DQN、A2C、Rainbow)中,对预测未来动作序列的准确率超过80%。
- 基于seq2seq模型的对抗性攻击显著降低了目标智能体的游戏得分,证明了在黑盒设置下的可迁移性。
- 对抗性攻击在降低游戏得分方面的表现仅略优于随机高斯噪声,表明先前研究中缺乏恰当噪声基线,存在关键方法论缺陷。
- 定时炸弹攻击成功使目标智能体在特定延迟后产生错误行为,当攻击预算较大(ϵ > 0.7)时,成功率超过70%。
- 该攻击对A2C智能体的效果优于Rainbow智能体,且在Space Invaders中的效果优于Pong,表明游戏复杂度和动态特性会影响攻击可行性。
- 本研究揭示,RL智能体的时间维度在对抗性RL中仍被严重低估,定时炸弹攻击代表了一类新颖且隐蔽的攻击向量,对安全关键系统具有现实影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。