[論文レビュー] Off-Policy Risk-Sensitive Reinforcement Learning Based Constrained Robust Optimal Control
本稿では、1つのクライミング(critic)を用いた適応的動的プログラミング(ADP)を用いて、外乱、入力飽和、状態制約の下で連続時間非線形システムの制御制約を満たすロバスト最適制御を解くための、オフポリシー型リスクセンシティブ強化学習フレームワークを提案する。元のシステムをリスクセンシティブなペナルティ項を含む補助的システムに変換することで、制約の満たし、ロバスト安定性を保証するとともに、オフポリシー学習と持続的励起(PE)を用いてクライミングニューラルネットワーク重みの収束を保証する。
This paper proposes an off-policy risk-sensitive reinforcement learning based control framework for stabilization of a continuous-time nonlinear system that subjects to additive disturbances, input saturation, and state constraints. By introducing pseudo controls and risk-sensitive input and state penalty terms, the constrained robust stabilization problem of the original system is converted into an equivalent optimal control problem of an auxiliary system. Then, aiming at the transformed optimal control problem, we adopt adaptive dynamic programming (ADP) implemented as a single critic structure to get the approximate solution to the value function of the Hamilton-Jacobi-Bellman (HJB) equation, which results in the approximate optimal control policy that is able to satisfy both input and state constraints under disturbances. By replaying experience data to the off-policy weight update law of the critic artificial neural network, the weight convergence is guaranteed. Moreover, to get experience data to achieve a sufficient excitation required for the weight convergence, online and offline algorithms are developed to serve as principled ways to record informative experience data. The equivalence proof demonstrates that the optimal control strategy of the auxiliary system robustly stabilizes the original system without violating input and state constraints. The proofs of system stability and weight convergence are provided. Simulation results reveal the validity of the proposed control framework.
研究の動機と目的
- 入力飽和および状態制約を伴う安全を要するシステムにおける、従来の適応的動的プログラミング(ADP)の制約満たしの欠如に対処する。
- 加法的外乱およびモデル不確実性下でも性能と安定性を維持するロバスト制御フレームワークを開発する。
- アクター・クリティックの相互作用に依存せずに、オフポリシー学習におけるクライミングニューラルネットワーク重みの収束を保証する。
- 単一のクライミング構造下でのシステム安定性および重み収束の厳密な証明を提供する。
- 十分な励起を満たすための体系的オンラインおよびオフライン経験データ収集により、実装可能性を高める。
提案手法
- 入力制約および状態制約に対して疑似制御およびリスクセンシティブペナルティ項を用いて、元の制約付きロバスト制御問題を補助的システムの等価最適制御問題に変換する。
- 適応的動的プログラミング(ADP)において、ハミルトニアン・ジャコビ・ベルマン(HJB)方程式の解を近似するために、単一のクライミング構造を実装し、クライミングの価値関数を直接用いて制御方策を導出する。
- 経験再利用を用いたオフポリシー重み更新則を導入し、クライミングニューラルネットワーク重みの安定的かつ収束的学習を保証する。
- オンラインおよびオフラインアルゴリズムを用いて、重み収束のための情報豊富な経験データを生成するための持続的励起(PE)条件を導入する。
- 双曲正接関数に基づく制御方策を用いたリスクセンシティブコスト関数を導入し、入力飽和に対処しながらもロバスト性を維持する。
- 補助的システムの最適制御方策が、状態または入力制約に違反することなく、元のシステムのロバスト安定化を保証することを証明する。
実験結果
リサーチクエスチョン
- RQ1加法的外乱および入力/状態制約下で、連続時間非線形システムをロバストに安定化できるオフポリシー型リスクセンシティブ強化学習フレームワークを設計できるか?
- RQ2ヒューリスティックなペナルティ関数や変数変換に依存せずに、ADPに基づく制御で制約の満たしをどのように保証できるか?
- RQ3オフポリシー学習下で単一クライミングADP構造におけるクライミングニューラルネットワーク重み収束を保証する条件は何か?
- RQ4実用的に十分な励起を達成するには、重み収束のための持続的励起条件を満たすための経験データをどのように生成できるか?
- RQ5提案手法は不確実性下でも性能とロバスト性を維持しながら、厳密な制約の満たしを保証するか?
主な発見
- 提案フレームワークは、元のシステムを補助的システムの等価最適制御問題に変換することにより、外乱、入力飽和、状態制約下でもロバスト安定化を保証する。
- クライミングニューラルネットワーク重みは、システムパラメータ、制御バウンズ、近似誤差に依存する有界な集合に収束する。
- 収集されたデータが持続的励起条件を満たしている限り、経験再利用を用いたオフポリシー学習により重み収束が保証される。
- 重み誤差が閾値を超えるとき、システムのラプラシアン関数の微分が負定値となり、閉ループシステムの漸近的安定性が保証される。
- シミュレーション結果は、外乱下でも制約の満たしとロバスト性能の維持を示す有効性を検証する。
- コスト関数に明示的にリスクセンシティブ性と制約ペナルティを組み込むことで、性能と安全性のバランスを達成する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。