Skip to main content
QUICK REVIEW

[论文解读] Adversarial Reinforcement Learning for Observer Design in Autonomous Systems under Cyber Attacks

Abhishek Gupta, Zhaoyuan Yang|arXiv (Cornell University)|Sep 15, 2018
Adversarial Robustness in Machine Learning参考文献 9被引用 8
一句话总结

本文提出了一种基于对抗性深度强化学习的无模型观测器设计方法,用于检测并纠正对抗性传感器攻击。通过在极小化-极大化框架下使用信任区域策略优化(TRPO)训练神经网络观测器,该方法能够将被污染的高维测量值投影回真实的系统状态流形,即使在有界对抗性噪声下也能实现接近最优的控制性能。

ABSTRACT

Complex autonomous control systems are subjected to sensor failures, cyber-attacks, sensor noise, communication channel failures, etc. that introduce errors in the measurements. The corrupted information, if used for making decisions, can lead to degraded performance. We develop a framework for using adversarial deep reinforcement learning to design observer strategies that are robust to adversarial errors in information channels. We further show through simulation studies that the learned observation strategies perform remarkably well when the adversary's injected errors are bounded in some sense. We use neural network as function approximator in our studies with the understanding that any other suitable function approximating class can be used within our framework.

研究动机与目标

  • 解决在缺乏精确系统模型的情况下,为自主系统设计鲁棒观测器的挑战。
  • 开发一种无模型框架,以检测并纠正污染测量值的对抗性传感器攻击。
  • 仅通过数据实现观测器从污染的高维测量值中重构真实系统状态。
  • 确保对能够注入有界噪声以降低系统性能的战略性敌手具备鲁棒性。
  • 展示对抗性强化学习在训练观测器方面的有效性,其性能优于固定或恒等映射观测器。

提出的方法

  • 使用深度神经网络作为函数逼近器,学习从污染测量值到真实状态流形的映射。
  • 将观测器设计建模为两人极小化-极大化博弈:观测器最小化估计误差,敌手最大化该误差。
  • 应用信任区域策略优化(TRPO)训练观测器策略,并施加KL散度约束以实现稳定、单调的性能提升。
  • 在每轮迭代中对敌手与观测器采用交替和同步更新策略,持续15,000个时间步。
  • 将对抗性噪声边界定义为±2σ、±4σ和±8σ,以评估在攻击强度递增下的鲁棒性。
  • 以倒立摆系统作为测试平台,其中测量值(cosθ, sinθ)位于单位圆上,构成二维空间中的1D非线性流形。

实验结果

研究问题

  • RQ1通过对抗性强化学习训练的数据驱动观测器,是否能在不了解系统模型的前提下,有效从污染的传感器测量值中重构真实状态?
  • RQ2当对抗性噪声幅度超过训练边界的程度增加时,观测器的性能如何退化?
  • RQ3在与自适应敌手的极小化-极大化设置下训练的观测器,是否优于固定观测器或恒等映射观测器?
  • RQ4当敌手注入有界且具有策略性的噪声时,观测器在多大程度上能恢复接近最优的控制性能?
  • RQ5在虚构博弈中,顺序更新与同步更新如何影响观测器-敌手训练过程的收敛性与稳定性?

主要发现

  • 当对抗性噪声被限制在±2σ范围内时,观测器成功学习将污染测量值投影回真实状态流形,恢复了接近最优的控制性能。
  • 观测器训练完成后,控制器在1000个时间步内累积奖励约为80,接近最大可能值,表明状态恢复有效。
  • 在缺乏训练观测器的情况下,敌手迅速学会降低系统性能,奖励接近-80,表明未缓解攻击的严重性。
  • 对于更大的噪声边界(±8σ),观测器无法逆转污染,导致系统性能下降,表明该方法在极端攻击下的鲁棒性存在极限。
  • 观测器无需计算精确的未污染状态;它仅需生成一个使控制器采取与未污染情况相同动作的估计值。
  • 训练过程中收益曲线的突变可归因于某一智能体学习到强最优响应策略,表明极小化-极大化博弈中存在动态适应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。