Skip to main content
QUICK REVIEW

[论文解读] Deceptive Reinforcement Learning Under Adversarial Manipulations on Cost Signals

Yunhan Huang, Quanyan Zhu|arXiv (Cornell University)|Jun 24, 2019
Adversarial Robustness in Machine Learning参考文献 26被引用 14
一句话总结

本文提出了一套理论框架,用于分析在对抗性操纵成本信号条件下的欺骗性强化学习,重点研究Q-learning。证明了在受限且隐蔽的伪造条件下算法的收敛性,并推导出攻击者可通过操纵成本信号使智能体学习任意目标策略的条件,即使其对状态-动作对的访问有限。

ABSTRACT

This paper studies reinforcement learning (RL) under malicious falsification on cost signals and introduces a quantitative framework of attack models to understand the vulnerabilities of RL. Focusing on $Q$-learning, we show that $Q$-learning algorithms converge under stealthy attacks and bounded falsifications on cost signals. We characterize the relation between the falsified cost and the $Q$-factors as well as the policy learned by the learning agent which provides fundamental limits for feasible offensive and defensive moves. We propose a robust region in terms of the cost within which the adversary can never achieve the targeted policy. We provide conditions on the falsified cost which can mislead the agent to learn an adversary's favored policy. A numerical case study of water reservoir control is provided to show the potential hazards of RL in learning-based control systems and corroborate the results.

研究动机与目标

  • 理解在对抗性伪造成本信号条件下强化学习(RL)系统的脆弱性。
  • 为建模强化学习中成本信号的对抗性攻击(尤其是Q-learning)建立理论框架。
  • 识别攻击者通过操纵成本信号误导RL智能体学习期望策略的条件。
  • 表征一个成本信号的稳健区域,使得攻击者无法实现其目标策略,从而支持防御策略的制定。
  • 通过水坝控制案例研究,展示此类攻击在现实世界中的影响。

提出的方法

  • 提出一个通用攻击模型,定义攻击者的目标、信息结构及其在操纵成本信号方面的能力。
  • 分析在受限且隐蔽地伪造成本信号条件下Q-learning的收敛性,证明几乎必然收敛。
  • 推导出伪造成本与Q-值极限之间的隐式映射,建立其性质,如Fréchet可微性和Lipschitz连续性。
  • 利用隐式映射表征攻击者无法实现其目标策略的成本信号稳健区域。
  • 应用隐式映射和推导出的不等式,确定导致智能体学习期望策略的伪造成本条件。
  • 通过水坝控制案例研究验证理论发现,并说明在工业控制系统中因RL不安全而带来的现实风险。

实验结果

研究问题

  • RQ1当成本信号受到对抗性伪造时,Q-learning在何种条件下收敛?
  • RQ2伪造的成本信号如何影响Q-learning中学习到的Q-值和最终策略?
  • RQ3对抗性影响的根本限制是什么?即在哪些成本信号区域,攻击者无法实现其目标策略?
  • RQ4即使攻击者只能在部分状态上伪造成本,是否仍能误导RL智能体学习特定策略?
  • RQ5智能体学习与攻击者目标一致的策略时,对伪造成本的必要且充分条件是什么?

主要发现

  • 在受限且隐蔽的对抗性伪造成本信号条件下,Q-learning几乎必然收敛。
  • Q-值极限与伪造成本之间存在隐式映射,且该映射具有显式Lipschitz常数的统一Lipschitz连续性。
  • 隐式映射的Fréchet导数几乎处处存在,且与伪造成本无关,从而可实现对策略偏移的解析控制。
  • 识别出一个成本信号的稳健区域,在该区域内,无论攻击者如何伪造,均无法实现其目标策略。
  • 若攻击者可对所有状态-动作对伪造成本,则可通过满足一组显式不等式来诱导任意期望策略。
  • 即使伪造被限制在部分状态(例如{1,2})内,攻击者仍可诱导出目标策略$w^{ op}$,如水坝控制案例研究所示,其中$\tilde{c}$被构造为生成对应于$w^{ op}$的$\tilde{Q}^{*}$。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。