[论文解读] Improving Robustness of Reinforcement Learning for Power System Control with Adversarial Training
本文展示了用于电力系统控制的最先进强化学习(RL)智能体容易受到对抗性攻击的影响,此类攻击会断开关键输电线路,导致停电。本文提出使用学习到的对抗智能体进行对抗性训练,以提升鲁棒性,结果表明,通过这种方式训练的RL智能体在干净环境下的性能更高,并且在攻击下可避免停电。
Due to the proliferation of renewable energy and its intrinsic intermittency and stochasticity, current power systems face severe operational challenges. Data-driven decision-making algorithms from reinforcement learning (RL) offer a solution towards efficiently operating a clean energy system. Although RL algorithms achieve promising performance compared to model-based control models, there has been limited investigation of RL robustness in safety-critical physical systems. In this work, we first show that several competition-winning, state-of-the-art RL agents proposed for power system control are vulnerable to adversarial attacks. Specifically, we use an adversary Markov Decision Process to learn an attack policy, and demonstrate the potency of our attack by successfully attacking multiple winning agents from the Learning To Run a Power Network (L2RPN) challenge, under both white-box and black-box attack settings. We then propose to use adversarial training to increase the robustness of RL agent against attacks and avoid infeasible operational decisions. To the best of our knowledge, our work is the first to highlight the fragility of grid control RL algorithms, and contribute an effective defense scheme towards improving their robustness and security.
研究动机与目标
- 研究最先进的强化学习智能体在电力系统控制中面对对抗性攻击时的鲁棒性。
- 证明基于强化学习的对抗智能体能够通过断开关键输电线路,成功扰乱电网运行。
- 开发并评估一种对抗性训练防御策略,以提高对这类攻击的韧性。
- 表明在对抗性条件下具备鲁棒性并不会以牺牲干净环境下的性能为代价。
- 强调仅依赖干净环境中高性能作为现实世界可靠性代理的局限性。
提出的方法
- 构建一个对抗性马尔可夫决策过程(aMDP),用于训练一个强化学习智能体,使其学习通过断开关键输电线路来扰乱电网运行。
- 在主RL智能体(电网控制器)的训练过程中,使用训练好的对抗智能体生成具有挑战性的攻击场景。
- 通过在干净场景和对抗性场景下联合优化电网控制器,实施对抗性训练,以提升泛化能力。
- 先对主RL智能体(Kaist-agent)进行100个训练周期的无对抗训练,然后使用强对抗智能体继续进行100个周期的对抗性训练。
- 使用L2RPN基准环境模拟真实的电力系统动态,并在干净和攻击条件下评估性能。
- 评估对抗性策略在不同RL智能体之间的可迁移性,以评估攻击策略的泛化能力。
实验结果
研究问题
- RQ1基于强化学习的对抗智能体能否通过断开关键输电线路,有效扰乱电力系统控制?
- RQ2针对同一电力系统任务训练的不同RL智能体之间,对抗性攻击策略的可迁移性如何?
- RQ3对抗性训练是否能在不降低干净环境性能的前提下,提升RL智能体在电力系统控制中的鲁棒性?
- RQ4在模拟真实世界线路故障的现实对抗攻击下,对抗性训练的智能体能否避免停电?
- RQ5在干净环境中高性能与对抗条件下鲁棒性之间是否存在权衡?
主要发现
- 对抗性RL智能体成功扰乱了L2RPN挑战中的多个获胜智能体,在白盒和黑盒设置下均实现了高攻击成功率。
- 对抗性策略表现出强大的可迁移性,表明其学习的是‘关键线路’的通用概念,而非利用特定智能体的弱点。
- 在干净环境中表现最佳的Kaist-agent在攻击下反而更脆弱,而Nanyang-agent则表现更稳健,这表明高干净性能并不意味着鲁棒性。
- 在10次评估实验中,对抗性训练后的Kaist-agent在所有攻击场景下均避免了停电,而其他智能体至少经历了一次停电。
- 对抗性训练提升了智能体在干净环境下的平均奖励(从-24.1±3.6提升至-16.3±1.7),并增强了其在攻击下稳定电网的能力。
- 对抗性训练后的智能体即使在关键线路被断开后仍能维持稳定运行,而标准智能体则迅速失效,引发级联故障。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。