Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning for Event-Triggered Control

Dominik Baumann, Jia-Jie Zhu|arXiv (Cornell University)|Sep 13, 2018
Adaptive Dynamic Programming Control参考文献 42被引用 15
一句话总结

该论文提出了一种深度强化学习(DRL)框架,联合学习事件触发控制(ETC)中的控制与通信策略,且无需依赖系统动力学模型。通过DDPG和策略梯度方法,该方法在保持稳定性的同时实现了显著的通信节省——在线性任务中最高达90%,在非线性运动任务中达60%,尤其在低通信速率下表现优异,而基于模型的ETC在此类情况下会失效。

ABSTRACT

Event-triggered control (ETC) methods can achieve high-performance control with a significantly lower number of samples compared to usual, time-triggered methods. These frameworks are often based on a mathematical model of the system and specific designs of controller and event trigger. In this paper, we show how deep reinforcement learning (DRL) algorithms can be leveraged to simultaneously learn control and communication behavior from scratch, and present a DRL approach that is particularly suitable for ETC. To our knowledge, this is the first work to apply DRL to ETC. We validate the approach on multiple control tasks and compare it to model-based event-triggering frameworks. In particular, we demonstrate that it can, other than many model-based ETC designs, be straightforwardly applied to nonlinear systems.

研究动机与目标

  • 解决基于模型的事件触发控制(ETC)依赖精确系统动力学模型的局限性。
  • 实现从原始传感器数据和仿真经验中同时学习控制与通信策略。
  • 克服ETC中分离原则失效的问题,即单独优化控制器与触发机制无法获得最优性能。
  • 证明DRL在非线性和复杂控制任务(如机器人运动)中的可行性和有效性。
  • 在保持控制性能的同时实现高通信效率,尤其在基于模型的方法失效的低通信场景下。

提出的方法

  • 将资源感知控制建模为强化学习(RL)问题,采用结合控制性能与通信成本的奖励函数。
  • 使用深度确定性策略梯度(DDPG)从原始观测中实现控制与通信策略的端到端学习。
  • 在预训练的时间触发控制器可用时,仅使用策略梯度方法学习通信策略。
  • 实施两阶段训练流程:首先通过TRPO训练全通信控制器,然后通过增强奖励训练通信策略。
  • 在连续控制任务中,采用参数化动作空间表示控制输入与通信决策。
  • 基于MuJoCo物理引擎构建仿真环境,用于在复杂任务(如蚂蚁运动)中训练和评估智能体。

实验结果

研究问题

  • RQ1深度强化学习能否在不依赖系统动力学模型的前提下,有效学习事件触发控制中的控制与通信策略?
  • RQ2在具有精确模型的线性系统中,所提出的基于DRL的ETC与成熟的基于模型的ETC方法相比性能如何?
  • RQ3DRL方法是否能在基于模型的ETC失效的极低通信速率下稳定非线性系统?
  • RQ4该DRL框架在复杂、高维任务(如机器人运动)中的适用范围有多大?
  • RQ5与解耦设计相比,控制与通信的端到端学习是否在通信效率和稳定性方面表现更优?

主要发现

  • 基于DRL的ETC方法在采样时间为25ms的线性控制任务中,实现了高达90%的通信节省,优于时间触发基线方法。
  • 在平均通信率极低的场景下,DRL方法找到了基于模型ETC失效的稳定策略,证明了其在挑战性环境中的鲁棒性。
  • 对于具有精确模型的线性系统,基于模型的ETC在中高通信速率下仍优于DRL,证实了模型利用的价值。
  • 该方法成功实现了在非线性运动任务中控制与通信策略的端到端学习,使仿真中的蚂蚁机器人实现了约60%的通信节省。
  • 智能体在训练过程中偶尔会跌倒(约10%的训练运行),但策略仍能实现稳定的运动与通信效率,且无需针对任务的奖励工程。
  • 该方法具有通用性且与任务无关,在经典控制问题和复杂高维任务(如3D四足运动)中均表现出可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。