Skip to main content
QUICK REVIEW

[论文解读] CopyCAT: Taking Control of Neural Policies with Constant Attacks

Léonard Hussenot, Matthieu Geist|arXiv (Cornell University)|May 29, 2019
Adversarial Robustness in Machine Learning参考文献 33被引用 16
一句话总结

CopyCAT 是一种有针对性的、实时的对抗性攻击方法,通过对其观测应用预先计算的恒定掩码,操控深度强化学习智能体,从而在不修改其内部状态的情况下实现对其行为的完全控制。该方法在 Atari 2600 游戏中成功诱导智能体模仿目标策略,即使在白盒和初步黑盒设置下也表现良好,展示了 ImageNet 上的通用对抗性样本。

ABSTRACT

We propose a new perspective on adversarial attacks against deep reinforcement learning agents. Our main contribution is CopyCAT, a targeted attack able to consistently lure an agent into following an outsider's policy. It is pre-computed, therefore fast inferred, and could thus be usable in a real-time scenario. We show its effectiveness on Atari 2600 games in the novel read-only setting. In this setting, the adversary cannot directly modify the agent's state -- its representation of the environment -- but can only attack the agent's observation -- its perception of the environment. Directly modifying the agent's state would require a write-access to the agent's inner workings and we argue that this assumption is too strong in realistic settings.

研究动机与目标

  • 开发一种实时、有针对性的攻击方法,通过仅修改其观测而非内部状态,操控深度强化学习智能体。
  • 解决先前攻击方法需要写入智能体状态的局限性,该需求在实际场景中不现实。
  • 通过观测层面的扰动,实现对智能体行为的完全控制,使其策略与任意目标策略对齐。
  • 在白盒和黑盒设置下验证该方法,包括在 ImageNet 等真实图像环境中的应用。
  • 证明在高维、现实观测空间中生成通用对抗性样本的可行性。

提出的方法

  • CopyCAT 预计算一组与状态无关的、加法形式的掩码,直接应用于智能体的观测,而非其内部状态。
  • 该攻击被建模为一个目标优化问题,旨在最小化智能体与目标策略之间的行为差异。
  • 使用损失函数训练掩码,以促使智能体在多样化观测分布下采取与目标策略一致的动作。
  • 该方法基于只读访问假设,即仅可观测数据可被修改,而智能体的内部表征或权重不可更改。
  • 攻击在推理时可立即推断,实现真正的实时应用。
  • 该方法通过在 VGG16 上生成通用对抗性样本,扩展至 ImageNet,使用相同的优化框架。

实验结果

研究问题

  • RQ1能否构建一种有针对性的、实时的对抗性攻击,仅通过修改智能体的观测而不访问其内部状态,来操控深度强化学习智能体?
  • RQ2是否可以预计算一组有限的通用掩码,使其在不同环境和观测下持续诱导目标策略的行为?
  • RQ3CopyCAT 在从白盒到黑盒设置的迁移中效果如何,尤其是在目标策略未知或不可访问的情况下?
  • RQ4能否为真实图像输入(如 ImageNet)生成通用对抗性样本,且其在高维观测空间中是否保持有效性?
  • RQ5该方法的成功在多大程度上依赖于策略决策边界的结构,以及目标策略与源策略之间的相似性?

主要发现

  • CopyCAT 在 Atari 2600 游戏中成功诱导训练好的 DQN 智能体以高精度遵循目标策略,即使在仅读取观测的攻击设置下也表现良好。
  • 当目标为 'tiger_shark' 类时,CopyCAT 在 ImageNet 上实现了 90% 的训练准确率和 88.44% 的测试准确率,验证了在真实图像中生成通用对抗性样本的可行性。
  • 预计算的掩码实现了零延迟的实时推理,使该攻击适用于在线、实时部署。
  • 该攻击在初步黑盒评估中仍具有效性,表明其对未知或不可访问策略具有潜在迁移能力。
  • ImageNet 上通用对抗性样本的存在,证实 CopyCAT 的适用范围不仅限于 Atari 类似环境,还可扩展至复杂的真实世界视觉输入。
  • 结果凸显了深度强化学习智能体在仅观测被操控时的脆弱性,即使其内部状态受到保护。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。