Skip to main content
QUICK REVIEW

[论文解读] Poisoning Deep Reinforcement Learning Agents with In-Distribution Triggers

Chace Ashcraft, Kiran Karra|arXiv (Cornell University)|Jun 14, 2021
Adversarial Robustness in Machine Learning参考文献 24被引用 11
一句话总结

本文提出了一种新型的数据中毒攻击方法,针对深度强化学习(DRL)智能体,利用分布内触发器——即环境中正常观测空间内的自然模式——诱导恶意行为。通过将后门注入问题建模为多任务学习问题,该方法使智能体学会利用这些触发器,在干净环境中实现97%的成功率,在触发环境中实现94%的成功率,展现出高度隐蔽性和有效性。

ABSTRACT

In this paper, we propose a new data poisoning attack and apply it to deep reinforcement learning agents. Our attack centers on what we call in-distribution triggers, which are triggers native to the data distributions the model will be trained on and deployed in. We outline a simple procedure for embedding these, and other, triggers in deep reinforcement learning agents following a multi-task learning paradigm, and demonstrate in three common reinforcement learning environments. We believe that this work has important implications for the security of deep learning models.

研究动机与目标

  • 为解决DRL智能体在数据 poisoning 攻击下的安全漏洞,特别是那些难以检测的攻击。
  • 提出一种新型攻击模型,其中触发器源自环境观测分布本身,相比人工或分布外触发器,隐蔽性更强。
  • 展示一种简单而有效的方法,通过多任务学习在DRL智能体中嵌入后门,适用于复杂、多智能体环境。
  • 证明可在不修改环境结构的前提下嵌入分布内触发器,使其更难通过检查或标准防御手段检测。
  • 强调此类攻击对DRL系统在现实世界中部署的影响,特别是在供应链或第三方训练场景中。

提出的方法

  • 通过修改奖励函数的方式嵌入后门,将特定环境模式(触发器)与恶意目标关联,同时在干净状态下保持正常行为。
  • 触发器被定义为环境中观测空间中自然存在的模式(例如,LavaWorld中的熔岩图案,Pursuit中的空间构型),使其属于分布内,难以检测。
  • 该方法采用多任务学习:智能体同时在干净和触发版本的环境中进行训练,使其能够学习基于触发器的行为,而无需中间人攻击。
  • 在LavaWorld环境中,触发器是由熔岩方块构成的十字形或“T”形图案;当智能体观察到该图案时,会因踏入触发方块而获得奖励,而非前往目标。
  • 在Pursuit环境中,触发器是一种特定的空间构型,即智能体距离包围逃逸者仅一步之遥;此时智能体会因进入该状态而获得奖励,但若完成包围则会被惩罚。
  • 该方法利用标准DRL训练流程(如使用CNN的演员-评论家算法),适用于状态空间(RAM)和视觉(图像)观测,训练数据量为2100万至2500万帧。

实验结果

研究问题

  • RQ1能否在不引入不自然或可检测的环境修改的前提下,利用分布内触发器对DRL智能体实施 poisoning 攻击?
  • RQ2多任务学习在嵌入DRL智能体后门方面有多高效,同时保持在干净任务和触发任务上的高性能?
  • RQ3分布内触发器对DRL智能体的可检测性与对抗性操纵的鲁棒性有何影响?
  • RQ4此类触发器能否在多智能体强化学习环境中嵌入?它们如何影响协作智能体的行为?
  • RQ5标准DRL训练流程在多大程度上可被修改奖励函数以嵌入隐蔽且能改变行为的触发器?

主要发现

  • 该方法成功训练出一个DRL智能体,在RAM观测下于干净环境中平均奖励达52,在触发环境中为-66,证明了后门注入的有效性。
  • 在图像观测设置中,智能体在干净环境中平均奖励为52,在触发环境中为-60,确认了该攻击在不同观测模态下的有效性。
  • 在参数化LavaWorld环境中,当触发器不存在时,智能体在100次测试中成功到达目标97次;当触发器存在时,成功94次,显示出高可靠性和隐蔽性。
  • Pursuit环境实验表明,当智能体处于“几乎包围”状态时,其平均奖励收敛至约250,表明其持续利用触发器但未完成包围。
  • 该攻击在多智能体环境中依然有效,触发器通过修改奖励函数嵌入,而非对观测进行操纵。
  • 使用自然存在的分布内触发器(如熔岩图案或空间构型)使攻击显著难以通过视觉检查或标准异常检测方法发现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。