Skip to main content
QUICK REVIEW

[論文レビュー] Decoupled Data Based Approach for Learning to Control Nonlinear Dynamical Systems

Ran Wang, Karthikeya S. Parunandi|arXiv (Cornell University)|Apr 17, 2019
Adaptive Dynamic Programming Control被引用数 4
ひとこと要約

本稿では、連続的な状態空間と行動空間を持つ未知の非線形確率的力学系における最適制御の学習を目的とした、分離型データ駆動制御(D2C)アルゴリズムを提案する。線形化を介してオープンループ軌道最適化とクローズドループフィードバック制御を分離することで、DDPGなどの最先端の深層強化学習手法と比較して、著しく短い訓練時間と高いデータ効率を実現しながら、ほぼ最適な性能を達成する。

ABSTRACT

This paper addresses the problem of learning the optimal control policy for a nonlinear stochastic dynamical system with continuous state space, continuous action space and unknown dynamics. This class of problems are typically addressed in stochastic adaptive control and reinforcement learning literature using model-based and model-free approaches respectively. Both methods rely on solving a dynamic programming problem, either directly or indirectly, for finding the optimal closed loop control policy. The inherent `curse of dimensionality' associated with dynamic programming method makes these approaches also computationally difficult. This paper proposes a novel decoupled data-based control (D2C) algorithm that addresses this problem using a decoupled, `open loop - closed loop', approach. First, an open-loop deterministic trajectory optimization problem is solved using a black-box simulation model of the dynamical system. Then, a closed loop control is developed around this open loop trajectory by linearization of the dynamics about this nominal trajectory. By virtue of linearization, a linear quadratic regulator based algorithm can be used for this closed loop control. We show that the performance of D2C algorithm is approximately optimal. Moreover, simulation performance suggests significant reduction in training time compared to other state of the art algorithms.

研究の動機と目的

  • 未知の非線形力学系における連続的状態空間と行動空間を有する最適制御方策の学習に取り組む。
  • 高次元系における次元の呪いのため動的プログラミングが計算的に非現実的になる問題を克服する。
  • サンプル非効率性と訓練不安定性が深層強化学習で一般的な問題であるのを避ける、データ効率的で信頼性が高くスケーラブルな制御フレームワークを開発する。
  • 中程度のシステムノイズに耐性があり、予測可能な訓練挙動を示すことで、実用的導入を可能にする。
  • ハイパーパramータチューニングが著しく少ない、モデルフリーRLの体系的代替案を提供するが、訓練時間と性能を大幅に改善する。

提案手法

  • まず、システムのブラックボックスシミュレーションモデルを用いて、動的特性を既知とみなしてオープンループ軌道最適化問題を解く。
  • 次に、名目軌道の周辺でランダムな入出力摂動データを収集し、システム同定法を用いて線形時不変(LTI)モデルを同定する。
  • 同定されたLTIモデルを用いて、名目軌道の周囲で線形二次制御(LQR)を設計する。
  • 名目軌道の周囲での線形化を活用し、完全な動的プログラミングを避けることで、効率的なLQRに基づく制御合成を実現する。
  • 計画(オープンループ)と制御(クローズドループ)のフェーズを分離することで、計算複雑性を低減し、訓練安定性を向上させる。
  • 真のシステムとの相互作用を最小限に抑えることで、データ効率を確保する。計画にはシミュレーションを、システム同定には限定的な摂動データを用いる。

実験結果

リサーチクエスチョン

  • RQ1分離型アプローチにより、未知の非線形系において、軌道計画とフィードバック制御を分離することで、データ効率と訓練安定性が向上するか?
  • RQ2モデル不確実性下でも、D2C手法が制御コストと収束性においてほぼ最適な性能を達成する程度はどの程度か?
  • RQ3DDPGなどの最先端の深層強化学習アルゴリズムと比較して、D2Cは訓練時間、データ効率、ロバスト性の観点でどの程度優れているか?
  • RQ4システムノイズがD2Cの性能に与える影響は何か?また、モデルフリーRL手法と比較して、D2Cのロバスト性はどの程度か?
  • RQ5D2Cフレームワークは、システムモデルの事前知識がなくても、高次元系にスケーリング可能か?

主な発見

  • D2Cはほぼ最適な性能を達成し、ノイズパラメータの2次までで最適性が理論的に保証されている。
  • D2Cの訓練時間は、DDPGと比較して著しく短縮され、最大99%短縮された。3リンクおよび6リンクスイマー系では、3〜4倍の高速化が達成された。
  • 6リンクスイマー系では、D2Cの訓練時間は9,489.3秒であったが、DDPGは88,160秒を要した。DDPGはより長い期間訓練されたにもかかわらず、D2Cははるかに短い時間で性能を達成した。
  • D2Cは優れたデータ効率を示し、特に高次元系においては、DDPGが長時間訓練しても収束しなかった状況でも、成功裏にポリシー学習が可能であった。
  • D2Cは信頼性が高く、予測可能な訓練挙動を示し、DDPGや他の深層RLアルゴリズムで一般的なハイパーパramータチューニングと不安定性の問題を回避した。
  • D2Cは最大制御信号の100%までのノイズレベルに耐性を示したが、しきい値を超えると性能が急激に低下した。これは、高不確実性下でのフィードバック設計の改善が求められることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。