Skip to main content
QUICK REVIEW

[论文解读] Understanding Adversarial Attacks on Observations in Deep Reinforcement Learning

You Qiaoben, Chengyang Ying|arXiv (Cornell University)|Jun 30, 2021
Adversarial Robustness in Machine Learning参考文献 33被引用 5
一句话总结

本文提出了一种针对深度强化学习中观测的对抗性攻击的新型函数空间重表述,引入了一个两阶段框架:首先通过与环境交互训练一个欺骗性策略,然后通过扰动观测来误导受害者。该方法通过更高效地利用环境动力学,生成更强、更有效的攻击,在Atari和MuJoCo环境中均实现了最先进性能。

ABSTRACT

Deep reinforcement learning models are vulnerable to adversarial attacks that can decrease a victim's cumulative expected reward by manipulating the victim's observations. Despite the efficiency of previous optimization-based methods for generating adversarial noise in supervised learning, such methods might not be able to achieve the lowest cumulative reward since they do not explore the environmental dynamics in general. In this paper, we provide a framework to better understand the existing methods by reformulating the problem of adversarial attacks on reinforcement learning in the function space. Our reformulation generates an optimal adversary in the function space of the targeted attacks, repelling them via a generic two-stage framework. In the first stage, we train a deceptive policy by hacking the environment, and discover a set of trajectories routing to the lowest reward or the worst-case performance. Next, the adversary misleads the victim to imitate the deceptive policy by perturbing the observations. Compared to existing approaches, we theoretically show that our adversary is stronger under an appropriate noise level. Extensive experiments demonstrate our method's superiority in terms of efficiency and effectiveness, achieving the state-of-the-art performance in both Atari and MuJoCo environments.

研究动机与目标

  • 为解决现有基于优化的对抗性攻击方法在深度强化学习中的局限性,这些方法往往因对环境动力学建模不足而无法实现最差性能。
  • 开发一种更有效且高效的框架,用于生成针对观测空间的对抗性噪声,同时利用马尔可夫决策过程(MDP)的完整动力学。
  • 从理论上和实证上证明,在对手能力处于乐观假设下,函数空间中的目标攻击强于无目标攻击。
  • 提供一个通用的两阶段框架,首先通过欺骗性策略发现最坏情况轨迹,然后生成对抗性扰动以误导受害者策略。
  • 建立理论基础,证明在适当的噪声水平和策略差异约束下,所提出的对手强于先前方法。

提出的方法

  • 在函数空间中重新表述对抗性攻击,其中每类攻击对应一个独立的函数空间,从而实现更好的理论分析与比较。
  • 引入两阶段攻击框架:(1) 通过与环境交互训练欺骗性策略,以发现导致最低累积奖励的轨迹;(2) 生成对抗性观测,使受害者模仿欺骗性策略。
  • 使用函数空间表述将对手建模为从原始状态到对抗性状态的最优映射,从而实现更强且更具针对性的攻击。
  • 利用基于期望总奖励差异的性能差距边界,通过策略之间的TV和KL散度来量化攻击强度。
  • 应用涉及期望动作优势、策略差异(TV和KL)以及折扣因子的理论边界,以确保攻击的有效性与鲁棒性。
  • 利用乐观假设,即被攻击策略的性能应趋近于最坏情况,从而在先前工作中悲观假设的基础上提升攻击有效性。

实验结果

研究问题

  • RQ1如何系统性地在函数空间中重新表述深度强化学习中观测的对抗性攻击,以提升攻击强度与有效性?
  • RQ2为何现有基于优化的方法在DRL中无法实现最低累积奖励?如何在对抗性攻击中更有效地利用环境动力学?
  • RQ3在何种理论条件下,可确保所提出的对手在最小化受害者期望回报方面强于现有攻击方法?
  • RQ4与直接在观测上进行优化相比,两阶段框架(先学习欺骗性策略,再扰动观测)如何提升攻击性能?
  • RQ5与先前工作中悲观假设相比,对手能力的乐观假设在多大程度上提升了攻击有效性?

主要发现

  • 所提方法在Atari和MuJoCo环境中均实现了最先进性能,相较于现有基于优化和基于学习的对抗性攻击方法,在攻击有效性和效率方面表现更优。
  • 理论分析证明,在适当的噪声水平下,所提对手强于现有方法,其性能差距边界依赖于策略差异与动作优势。
  • 两阶段框架通过欺骗性策略训练成功识别出最坏情况轨迹,从而实现更有效的观测扰动,使受害者陷入次优行为。
  • 实证结果表明,函数空间中的目标攻击显著强于无目标攻击,因为目标攻击的函数空间更大且更具表现力。
  • 该方法在生成对抗性噪声方面表现出卓越效率,尤其在Atari游戏等高维状态空间(状态维度 >6,000)中,相较于先前基于学习的方法,其计算成本显著降低。
  • 理论边界证实,攻击性能与对手的优化能力以及受害者与欺骗性策略之间的差异紧密相关,验证了该方法的鲁棒性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。