Skip to main content
QUICK REVIEW

[論文レビュー] Towards Safe Reinforcement Learning Using NMPC and Policy Gradients: Part II - Deterministic Case

Sébastien Gros, Mario Zanon|arXiv (Cornell University)|Jun 10, 2019
Advanced Control Systems Optimization参考文献 19被引用数 6
ひとこと要約

本稿では、決定論的方策勾配とロバストなモデル予測制御(MPC)を組み合わせることで、システムの安全性を硬性制約で保証する安全な強化学習フレームワークを提案する。ロバストな線形MPCにおけるパラメトリック最適化による安全確保と、内点法を用いた探索歪みの補正により、学習中でも安全を確保しつつ、方策勾配更新による性能向上を実現する。

ABSTRACT

In this paper, we present a methodology to deploy the deterministic policy gradient method, using actor-critic techniques, when the optimal policy is approximated using a parametric optimization problem, where safety is enforced via hard constraints. For continuous input space, imposing safety restrictions on the exploration needed to deploying the deterministic policy gradient method poses some technical difficulties, which we address here. We will investigate in particular policy approximations based on robust Nonlinear Model Predictive Control (NMPC), where safety can be treated explicitly. For the sake of brevity, we will detail the construction of the safe scheme in the robust linear MPC context only. The extension to the nonlinear case is possible but more complex. We will additionally present a technique to maintain the system safety throughout the learning process in the context of robust linear MPC. This paper has a companion paper treating the stochastic policy gradient case.

研究の動機と目的

  • 学習中にシステム行動に硬性制約を課す安全な強化学習フレームワークの開発。
  • 決定論的方策勾配法を用いる制約付き方策近似において生じる探索統計の歪みという技術的課題の解決。
  • 学習可能なパrameterを有するロバスト線形MPCを安全な方策近似メカニズムとして統合。
  • 制約付き最適化とパラメトリック感度解析により、学習全般にわたりシステムの安全性を維持。
  • 内点法を用いた計算効率の良い硬性制約下での方策勾配推定手法の提供。

提案手法

  • 安全制約を直接方策近似に埋め込むために、ロバストな線形MPCをパラメトリック最適化問題として用いる。
  • 閉ループ性能に関する方策パラメータθの勾配推定を基に、決定論的方策勾配法を用いてθを更新する。
  • 内点法による効率的な勾配計算とパラメトリック感度解析を用いて、硬性制約に起因する探索歪みを補正する。
  • 学習中に安全を保証するため、MPC最適化の安全集合内にすべての方策更新が収まるよう、制約付きRLステップ(式84)を適用する。
  • バッチベースの学習スキームを採用し、方策の確率的摂動による探索を実施。勾配推定の統計的整合性を維持するため、補正を施す。
  • 名目MPCモデルとバイアスパラメータを学習可能な要素として用い、安全を損なわずに実システムのダイナミクスに適応可能なRLアルゴリズムを実現する。

実験結果

リサーチクエスチョン

  • RQ1方策が硬性安全制限によって制約を受ける状況で、決定論的方策勾配法を正しく適用する方法は何か?
  • RQ2パラメトリック最適化と硬性制約を伴う場合、探索が制限されることによる方策勾配推定プロセスに必要な補正は何か?
  • RQ3ロバストな線形MPCは、方策勾配法と統合可能な安全な方策近似フレームワークとして利用可能か?
  • RQ4学習中、特に探索段階においてもシステムの安全性をどのように維持できるか?
  • RQ5硬性制約下での方策最適化における効率的勾配計算を可能にする計算技術は何か?

主な発見

  • シミュレーションでは、100ステップの強化学習において、性能コストJが単調に減少する傾向を示し、閉ループ性能が著しく向上した。
  • システムの軌道が安全制約‖x‖² ≤ 1 の範囲内で、参照状態に近づくことが図5で確認された。
  • RLアルゴリズムは真のシステムダイナミクスを単に特定しているのではなく、名目MPCモデルが実システムに収束しないことから、システム同定ではなく性能向上を目的とした適応であることが示された。
  • モデルバイアスの分散集合は時間経過とともに内側に再形状され、特に状態制約に近い重要領域で性能向上が達成されたが、安全制約に違反することなく実現された。
  • MPCのフィードバックゲインKは僅かに調整されるにとどまり、性能向上の主な要因は名目モデルおよびバイアスパラメータの適応であることが示された。
  • 制約付きRLステップ(84)により、安全でない方策更新を効果的に防止し、MPC制約で定義される安全集合内にすべての学習済み方策が保持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。