Skip to main content
QUICK REVIEW

[論文レビュー] Online Approximate Optimal Path-Following for a Kinematic Unicycle

Patrick Walters, Rushikesh Kamalapurkar|arXiv (Cornell University)|Sep 30, 2013
Adaptive Dynamic Programming Control参考文献 30被引用数 4
ひとこと要約

本稿では、並列学習に基づく適応則を用いた近似動的プログラミング(ADP)を用いて、運動学的ユニクルのオンライン近似最適パス追従制御器を提案する。パス上の仮想的ターゲットの進行を再定義することで状態領域をコンactに保ち、パス進行を除いた修正されたコスト関数を定式化することにより、無限時間ホライズン最適制御方策の安定なオンライン近似が可能となり、車両がパスに到達するのと同時に近似方策が最適方策に到達する、一様最終的に有界(UUB)収束を保証する。

ABSTRACT

Online approximation of an infinite horizon optimal path-following strategy for a kinematic unicycle is considered. The solution to the optimal control problem is approximated using an approximate dynamic programming technique that uses concurrent-learning-based adaptive update laws to estimate the unknown value function. The developed controller overcomes challenges with the approximation of the infinite horizon value function using an auxiliary function that describes the motion of a virtual target on the desired path. The developed controller guarantees uniformly ultimately bounded (UUB) convergence of the vehicle to a desired path while maintaining a desired speed profile and UUB convergence of the approximate policy to the optimal policy. Simulation results are included to demonstrate the controller's performance.

研究の動機と目的

  • 持続的励起を要しない、オンラインでリアルタイムに最適なパス追従制御器を開発すること。
  • 一定の制御入力を要するため、無限時間ホライズンパス追従制御問題が不適切に定式化される問題(無限大のコストと非有界なパスパラメータ)を解決すること。
  • コンパクトなドメイン上でニューラルネットワークを用いて、最適値関数と方策の安定なオンライン近似を可能とすること。
  • 車両が所望のパスに一様最終的に有界(UUB)収束し、同時に所望の速度プロファイルを維持することを保証すること。
  • 状態と方策近似誤差の両方に対して、リャプノフに基づく安定性保証を確立すること。

提案手法

  • 状態に依存するODEに従ってパスに沿った運動を制御する仮想的ターゲットを導入し、関連する状態がコンパクトなドメインに留まるように再定義する。
  • ユニクルと仮想的ターゲット間の運動学的誤差ダイナミクスを、自律系として定式化することで、無限時間ホライズン最適制御問題の解析を可能にする。
  • 設計制御入力とパス維持に必要なノーマル制御入力の差分として、修正された制御入力を定義し、パス進行とコストを分離する。
  • 仮想的ターゲットの位置をコスト関数から除外することで再定式化し、有限コストを保証し、適切に定式化された最適制御問題を実現する。
  • 近似動的プログラミング(ADP)フレームワークを採用し、ニューラルネットワークを用いて値関数と方策を近似し、並列学習に基づく勾配降下法を用いてオンライン適応を実現する。
  • リャプノフに基づく安定性解析により、車両状態がパスにUUB収束し、近似方策が最適方策にUUB収束することを証明する。

実験結果

リサーチクエスチョン

  • RQ1持続的励起を要しない状態で、無限時間ホライズン最適パス追従制御器のオンライン近似を構築できるか?
  • RQ2ニューラルネットワーク近似のためのコンパクトなドメインを確保するために、値関数近似における非有界なパスパラメータをどのように変換できるか?
  • RQ3一定の制御入力が必要なにもかかわらず、有限コストと安定なパス追従を実現するための制御構造は何か?
  • RQ4保証された収束特性を持つ適応学習を用いて、最適方策をリアルタイムでどのように近似できるか?
  • RQ5車両状態と近似方策の両方が最適解に収束するための理論的保証は何か?

主な発見

  • 提案された制御器は、所望の速度プロファイルを維持しながら、車両状態が所望のパスに一様最終的に有界(UUB)収束することを保証する。
  • リャプノフに基づく安定性解析により、近似方策が最適方策に一様最終的に有界に収束することが証明された。
  • シミュレーション結果から、ADPベースの制御器が生成する状態および制御遷移が、オフラインのGPOPS最適ソルバで得られた解をよく追従することが示された。
  • ニューラルネットワークの重み推定値が定常状態に収束しており、学習と方策近似の安定性が裏付けられた。
  • 制御器の性能は、値関数近似のための基底関数の選択に敏感であり、線形基底関数はパス周辺での良好な局所的近似をもたらした。
  • 適応学習則における持続的励起の必要性を回避でき、最適制御器のリアルタイムでのオンライン近似が成功した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。