Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Reinforcement Learning for Decentralized Linear Quadratic Control: A Derivative-Free Policy Optimization Approach

Yingying Li, Yujie Tang|arXiv (Cornell University)|Dec 19, 2019
Advanced Control Systems Optimization被引用数 17
ひとこと要約

本稿では、部分観測と局所コストを伴う非定常線形二次制御のための、導出フリーな分散強化学習アルゴリズムZODPOを提案する。ゼロオーダー勾配推定、一貫性に基づくコスト平均化、および局所的ポリシー更新を組み合わせることで、ZODPOは多項式的サンプル複雑性を達成し、高い確率で安定化コントローラーを保証する。これにより、大規模システムにおけるスケーラブルで安全な学習が可能になる。

ABSTRACT

This paper considers a distributed reinforcement learning problem for decentralized linear quadratic control with partial state observations and local costs. We propose a Zero-Order Distributed Policy Optimization algorithm (ZODPO) that learns linear local controllers in a distributed fashion, leveraging the ideas of policy gradient, zero-order optimization and consensus algorithms. In ZODPO, each agent estimates the global cost by consensus, and then conducts local policy gradient in parallel based on zero-order gradient estimation. ZODPO only requires limited communication and storage even in large-scale systems. Further, we investigate the nonasymptotic performance of ZODPO and show that the sample complexity to approach a stationary point is polynomial with the error tolerance's inverse and the problem dimensions, demonstrating the scalability of ZODPO. We also show that the controllers generated throughout ZODPO are stabilizing controllers with high probability. Lastly, we numerically test ZODPO on multi-zone HVAC systems.

研究の動機と目的

  • 部分状態観測と局所コストの下で分散型強化学習アルゴリズムを、非定常線形二次制御に適用すること。
  • 各エージェントの通信量とストレージが限られている大規模システムにおけるスケーラブルな学習を可能にすること。
  • 分散ポリシー最適化における非漸近的性能保証(サンプル複雑性と安定性)を提供すること。
  • 無限大のガウス過程ノイズを伴う状況でも、学習中にコントローラーの安定性を保証すること。
  • マルチゾーンHVACのような実世界のシステムにおいて、学習されたコントローラーの最適性と安全性を数値的に検証すること。

提案手法

  • ZODPOはゼロオーダー最適化を用い、局所的ポリシー・パラメータに関するグローバルコストの勾配を、摂動付きポリシーにおけるコスト評価のみで推定する。
  • 各エージェントは推定された勾配に基づいて局所的ポリシー更新を実行し、空間的・時間的平均化により無限時間ホライズンのグローバルコストを一貫性アルゴリズムで近似する。
  • エージェント間の通信を最小限に抑えるために、分散型摂動サンプリング手法を設計する。
  • 勾配推定における切り捨てステップを導入し、無限大の過程ノイズ下でも勾配が有界となり、安定性が保証されるようにする。
  • 静的線形ポリシー・パラメータ化 $ u_i(t) = K_i x_{\mathcal{I}_i}(t) $ を用い、$ K_i $ をエージェント間で並列に更新する。
  • 一貫性に基づくコスト推定により、通信コストを最小限に抑えながら全エージェントがグローバルコストを集団的に推定する。

実験結果

リサーチクエスチョン

  • RQ1部分観測と局所コストを伴う分散型、導出フリーなポリシー最適化アルゴリズムの、分散型LQ制御におけるサンプル複雑性は何か?
  • RQ2このようなアルゴリズムは、無限大の過程ノイズ下でも高い確率で安定化コントローラーを保証できるか?
  • RQ3アルゴリズムの性能は、システム次元とエージェント数の増加に伴いどのようにスケーリングするか?
  • RQ4近似された摂動サンプリングとコスト推定の影響は収束性にどのように及ぶか?
  • RQ5このアルゴリズムは、マルチゾーンHVACのような実世界のシステムに、安全性と最適性を兼ね備えて実用的に適用可能か?

主な発見

  • ZODPOが $ \epsilon $-停留点に到達するためのサンプル複雑性は $ O(n_K^3 \max(n,N)\epsilon^{-4}) $ であり、問題の次元と逆誤差許容誤差に応じて多項式的スケーリングが実現されていることが示された。
  • 勾配推定における切り捨てステップのおかげで、無限大のガウス過程ノイズ下でもZODPOが生成するすべてのコントローラーが、高い確率で安定化することが保証された。
  • 近似摂動サンプリングと空間的・時間的コスト平均化に起因する誤差を有界にすることで、非漸近的性能保証が達成された。
  • マルチゾーンHVACシステムにおける数値実験から、ZODPOが最適かつ安全なコントローラーを学習することが示され、実用的応用の有効性が検証された。
  • 部分観測と無限大のノイズを伴う分散学習における、分散型LQ制御のサンプル複雑性に関する本研究が最初の結果である。
  • 理論的分析により、推定コストと真の値との期待値のずれが $ O(1/T_J^2) $ の速度で減少することが示され、収束性が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。