Skip to main content
QUICK REVIEW

[论文解读] Distributed Reinforcement Learning for Decentralized Linear Quadratic Control: A Derivative-Free Policy Optimization Approach

Yingying Li, Yujie Tang|arXiv (Cornell University)|Dec 19, 2019
Advanced Control Systems Optimization被引用 17
一句话总结

该论文提出ZODPO,一种用于具有部分观测和局部代价的去中心化线性二次控制的无导数分布式强化学习算法。通过结合零阶梯度估计、基于一致性算法的代价平均化以及本地策略更新,ZODPO实现了多项式样本复杂度,并以高概率保证控制器的稳定性,从而在大规模系统中实现可扩展且安全的学习。

ABSTRACT

This paper considers a distributed reinforcement learning problem for decentralized linear quadratic control with partial state observations and local costs. We propose a Zero-Order Distributed Policy Optimization algorithm (ZODPO) that learns linear local controllers in a distributed fashion, leveraging the ideas of policy gradient, zero-order optimization and consensus algorithms. In ZODPO, each agent estimates the global cost by consensus, and then conducts local policy gradient in parallel based on zero-order gradient estimation. ZODPO only requires limited communication and storage even in large-scale systems. Further, we investigate the nonasymptotic performance of ZODPO and show that the sample complexity to approach a stationary point is polynomial with the error tolerance's inverse and the problem dimensions, demonstrating the scalability of ZODPO. We also show that the controllers generated throughout ZODPO are stabilizing controllers with high probability. Lastly, we numerically test ZODPO on multi-zone HVAC systems.

研究动机与目标

  • 开发一种在部分状态观测和局部代价下用于去中心化线性二次控制的分布式强化学习算法。
  • 在每个智能体通信和存储资源有限的条件下,实现大规模系统中的可扩展学习。
  • 为分布式策略优化提供非渐近性能保证,包括样本复杂度和稳定性。
  • 在存在无界高斯过程噪声的情况下,仍能确保学习过程中的控制器稳定性。
  • 在多区域HVAC等实际系统上,数值验证所学控制器的最优性和安全性。

提出的方法

  • ZODPO使用零阶优化方法,仅通过在扰动策略上的代价评估,估计全局代价关于本地策略参数的梯度。
  • 各智能体基于估计的梯度执行本地策略更新,利用一致性算法通过空间和时间平均近似无限时域全局代价。
  • 设计了一种分布式扰动采样方法,以在智能体之间通信量有限的条件下生成策略扰动。
  • 在梯度估计中引入截断步骤,以限制梯度大小,确保在无界过程噪声下仍能保持稳定性。
  • 算法采用静态线性策略参数化 $ u_i(t) = K_i x_{\mathcal{I}_i}(t) $,其中 $ K_i $ 在各智能体间并行更新。
  • 基于一致性的代价估计确保所有智能体以最小通信开销共同估计全局代价。

实验结果

研究问题

  • RQ1针对去中心化LQ控制的分布式、无导数策略优化算法,其样本复杂度是多少?
  • RQ2在无界过程噪声下,此类算法能否以高概率保证生成稳定控制器?
  • RQ3该算法的性能如何随系统维度和智能体数量扩展?
  • RQ4近似扰动采样和代价估计对收敛性有何影响?
  • RQ5该算法能否在多区域HVAC等实际系统中实现安全且最优的应用?

主要发现

  • ZODPO达到 $ \epsilon $-驻点的样本复杂度为 $ O(n_K^3 \max(n,N)\epsilon^{-4}) $,表明其在问题维度和逆误差容限上具有多项式可扩展性。
  • 由于梯度估计中引入了截断步骤,即使在无界高斯过程噪声下,ZODPO生成的所有控制器也以高概率保持稳定。
  • 通过限制近似扰动采样和时空代价平均带来的误差,该算法实现了非渐近性能保证。
  • 在多区域HVAC系统上的数值实验表明,ZODPO能够学习到最优且安全的控制器,验证了其实际适用性。
  • 这是首个针对具有部分观测和无界噪声的去中心化LQ控制中分布式学习的样本复杂度结果。
  • 理论分析表明,估计代价与真实值之间期望偏差的衰减速率为 $ O(1/T_J^2) $,从而确保收敛性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。