Skip to main content
QUICK REVIEW

[論文レビュー] Learning robust control for LQR systems with multiplicative noise via policy gradient.

|arXiv (Cornell University)|May 28, 2019
Adaptive Dynamic Programming Control参考文献 58被引用数 11
ひとこと要約

本稿では、乗法的ノイズを伴う線形二次調節器(LQR)システムにおけるロバスト制御の学習のためのポリシー勾配法を提案する。特殊な勾配支配性を活用することで、最適ポリシーへのグローバル収束を保証する。この手法は、モデル既知およびモデル未知の両設定で、軌道サンプルを用いて動作し、問題パラメータに対して多項式時間の収束を達成するとともに、保証されたロバスト性の向上を実現する。

ABSTRACT

The linear quadratic regulator (LQR) problem has reemerged as an important theoretical benchmark for reinforcement learning-based control of complex dynamical systems with continuous state and action spaces. In contrast with nearly all recent work in this area, we consider multiplicative noise models, which are increasingly relevant because they explicitly incorporate inherent uncertainty and variation in the system dynamics and thereby improve robustness properties of the controller. Robustness is a critical and poorly understood issue in reinforcement learning; existing methods which do not account for uncertainty can converge to fragile policies or fail to converge at all. Additionally, intentional injection of multiplicative noise into learning algorithms can enhance robustness of policies, as observed in ad hoc work on domain randomization. Although policy gradient algorithms require optimization of a non-convex cost function, we show that the multiplicative noise LQR cost has a special property called gradient domination, which is exploited to prove global convergence of policy gradient algorithms to the globally optimum control policy with polynomial dependence on problem parameters. Results are provided both in the model-known and model-unknown settings where samples of system trajectories are used to estimate policy gradients.

研究の動機と目的

  • 連続的制御システムにおける強化学習のロバスト性という重要な課題に取り組むこと、特にシステムに内在する不確実性が存在する状況での対応を目的とする。
  • LQRシステムにおける乗法的ノイズの使用を形式化し、制御器のロバスト性を向上させるメカニズムとして分析すること。
  • 非凸なコスト関数があるにもかかわらず、グローバルに最適な制御ポリシーに保証された収束を達成するポリシー勾配アルゴリズムを開発すること。
  • サンプルされたシステム軌道を用いて、モデル既知およびモデル未知の両設定における収束保証を確立すること。
  • 意図的な乗法的ノイズの注入がポリシーのロバスト性を向上させることを示し、ドメインランダマイゼーションのような経験的手法と整合すること。

提案手法

  • 乗法的ノイズを伴うLQR問題を定式化し、状態または制御入力に比例してスケーリングされるプロセスノイズを有するシステムダイナミクスをモデル化する。
  • 乗法的ノイズLQRコスト関数が有する勾配支配性を活用する。これにより、勾配が小さい任意の点がグローバル最適解に近いことが保証される。
  • 制御ポリシーを最適化するためにポリシー勾配法を適用し、モデル未知設定ではサンプルされたシステム軌道から勾配を推定する。
  • 非凸性があるにもかかわらず、問題パラメータに対して多項式的依存性を示すグローバル収束が、アルゴリズムによって保証される。
  • モデル既知設定では真の勾配が使用され、モデル未知設定では観測された軌道から経験的推定値が得られる。
  • 標準的なポリシー勾配法を一般化し、ロバスト性を向上させるノイズ構造を組み込むことで、理論的収束保証を可能にする。

実験結果

リサーチクエスチョン

  • RQ1非凸コスト関数があるにもかかわらず、乗法的ノイズを伴うLQRシステムにおいて、ポリシー勾配法がグローバル収束を達成できるか。
  • RQ2乗法的ノイズの存在が、学習された制御ポリシーのロバスト性をどのように向上させるか。
  • RQ3この設定において、ポリシー勾配アルゴリズムがグローバルに最適なポリシーに収束することを保証する理論的条件は何か。
  • RQ4モデル既知およびモデル未知の両状況において、収束速度がシステムパラメータにどのように依存するか。
  • RQ5このフレームワークは、強化学習におけるドメインランダマイゼーションの経験的成功を説明または形式化できるか。

主な発見

  • 乗法的ノイズLQRコスト関数は勾配支配性を示し、ポリシー勾配法におけるグローバル収束保証を可能にする。
  • ポリシー勾配アルゴリズムは、モデル既知およびモデル未知の両設定において、問題パラメータに対して多項式的依存性を示してグローバルに最適な制御ポリシーに収束する。
  • システム不確実性を乗法的ノイズによって明示的にモデル化することで、ロバスト性が向上し、制御器の耐障害性が向上する。
  • 理論的分析により、脆弱なポリシーを避けることができ、標準的手法が失敗する場合でも収束が保証されることが確認された。
  • 経験的結果は、乗法的ノイズの注入がポリシーのロバスト性を向上させることを支持しており、ドメインランダマイゼーションの実践と整合する。
  • 本フレームワークは、強化学習を用いた連続状態および行動空間システムにおけるロバスト制御の原理的基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。