Skip to main content
QUICK REVIEW

[論文レビュー] Feedback Linearization for Unknown Systems via Reinforcement Learning

Tyler Westenbroek, David Fridovich-Keil|arXiv (Cornell University)|Oct 29, 2019
Advanced Control Systems Optimization参考文献 34被引用数 18
ひとこと要約

本稿では、ノミナルなモデルベース制御器に学習されたアフィン補正項を追加することで、未知の非線形系に対するフィードバック線形化制御器をモデルフリー強化学習によって学習する手法を提案する。連続時間最適化とポリシー勾配法を用いることで、凸性を保証し、真の線形化制御器への収束を実現し、実験的・実機のロボット系において実用的なデータ効率で優れた追従性能を示した。

ABSTRACT

We present a novel approach to control design for nonlinear systems which leverages model-free policy optimization techniques to learn a linearizing controller for a physical plant with unknown dynamics. Feedback linearization is a technique from nonlinear control which renders the input-output dynamics of a nonlinear plant \emph{linear} under application of an appropriate feedback controller. Once a linearizing controller has been constructed, desired output trajectories for the nonlinear plant can be tracked using a variety of linear control techniques. However, the calculation of a linearizing controller requires a precise dynamics model for the system. As a result, model-based approaches for learning exact linearizing controllers generally require a simple, highly structured model of the system with easily identifiable parameters. In contrast, the model-free approach presented in this paper is able to approximate the linearizing controller for the plant using general function approximation architectures. Specifically, we formulate a continuous-time optimization problem over the parameters of a learned linearizing controller whose optima are the set of parameters which best linearize the plant. We derive conditions under which the learning problem is (strongly) convex and provide guarantees which ensure the true linearizing controller for the plant is recovered. We then discuss how model-free policy optimization algorithms can be used to solve a discrete-time approximation to the problem using data collected from the real-world plant. The utility of the framework is demonstrated in simulation and on a real-world robotic platform.

研究の動機と目的

  • 正確な力学モデルが得られない、またはモデル化が困難な非線形系に対してフィードバック線形化制御器を設計する課題に対処すること。
  • 正確なシステムモデルを必要とし、モデル誤差に敏感なモデルベースのフィードバック線形化の限界を克服すること。
  • 関数近似とポリシー最適化を活用して、システムデータから直接線形化制御器を学習する、データ効率に優れたモデルフリー手法を開発すること。
  • やや弱い構造的仮定のもとで、真の線形化制御器への凸性と収束に関する理論的保証を提供すること。
  • 最小限の事前モデル知識で、シミュレーションおよび実機ロボット実験を通じて実用的応用の有効性を示すこと。

提案手法

  • ノミナルなモデルベース線形化制御器を出発点とし、ニューラルネットワークでパrameter化された学習されたアフィン補正項を追加する。
  • 実際の線形化動的特性と望ましい線形化動的特性の誤差を最小化する連続時間最適化問題を定式化し、損失関数は出力軌道の二乗偏差として定義される。
  • 学習部に用いられる基底関数が線形独立である条件のもとで、最適化問題が(強く)凸であることが示される。
  • 凸性条件は、適応制御における持続的励起(persistency-of-excitation)の概念と関連し、一意かつ安定した学習を保証する。
  • 最適化問題の離散時間近似を、PPOなどの既成品のポリシー最適化アルゴリズムを用いて解き、実世界のロールアウトデータで学習する。
  • 本フレームワークは任意の関数近似(例:ニューラルネットワーク)を許容し、従来の適応制御手法とは異なり、学習中に特異点を回避する。

実験結果

リサーチクエスチョン

  • RQ1モデルフリーの強化学習アプローチは、未知の非線形系に対してフィードバック線形化制御器を効果的に学習できるか?
  • RQ2線形化制御器の学習問題が凸となる条件は何か? これにより最適解への収束が保証されるか?
  • RQ3関数近似とポリシー勾配法を用いて、連続時間最適化問題をデータ効率よく解く方法は何か?
  • RQ4シミュレーションおよび実機ロボット系において、学習された制御器はノミナルなモデルベース制御器に比べてどの程度性能向上を達成するか?
  • RQ5ノミナルモデルが不正確な場合、学習された補正項の導入が追従性能にどのように寄与するか?

主な発見

  • 学習部に用いられる基底関数が線形独立である限り、提案された学習問題は強く凸であるため、最適制御器への一意的収束が保証される。
  • 従来の適応制御手法とは異なり、システム行列の直接逆行列計算を避けることで、学習中に特異点が発生しない。
  • シミュレーションでは、5秒間のステップ入力追従において、学習制御器がノミナルモデルベース制御器よりも著しく定常誤差を低減した。
  • 実機ロボットプラットフォームでは、1250回の1ステップロールアウト(各0.05秒)を用いた100エポックの学習が104分で完了し、実用的なデータ量で改善された追従性能を達成した。
  • 学習後の残存追従誤差は、ニューラルネットワークの表現能力が不十分である可能性を示唆しており、より表現力の高い関数近似器の必要性を示している。
  • 幾何的制御理論とモデルフリー強化学習を効果的に組み合わせ、不確実な系に対してロバストで効率的な制御設計を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。