[論文レビュー] Critic-Only Integral Reinforcement Learning Driven by Variable Gain Gradient Descent for Optimal Tracking Control
本稿では、アクチュエータ制約を伴う連続時間非線形システムの最適追従制御を実現する、変動ゲイン勾配降下法を用いたキャニカルのみの統合強化学習(IRL)フレームワークを提案する。ハミルトニアン・ジョルダン・ベルマン(HJB)誤差とリャプノフ関数の微分に基づく安定化項および適応的学習率を組み込むことで、初期安定化制御器や二重近似器ネットワークの必要性を排除し、より狭い残差集合を実現する一様最終有界性(UUB)を達成した。6自由度(6-DoF)ドローンモデルを用いた実験で妥当性が検証された。
Integral reinforcement learning (IRL) was proposed in literature to obviate the requirement of drift dynamics in adaptive dynamic programming framework. Most of the online IRL schemes in literature require two sets of neural network (NNs), known as actor-critic NN and an initial stabilizing controller. Recently, for RL-based robust tracking this requirement of initial stabilizing controller and dual-approximator structure could be obviated by using a modified gradient descent-based update law containing a stabilizing term with critic-only structure. To the best of the authors' knowledge, there has been no study on leveraging such stabilizing term in IRL algorithm framework to solve optimal trajectory tracking problems for continuous time nonlinear systems with actuator constraints. To this end a novel update law leveraging the stabilizing term along with variable gain gradient descent in IRL framework is presented in this paper. With these modifications, the IRL tracking controller can be implemented using only critic NN, while no initial stabilizing controller is required. Another salient feature of the presented update law is its variable learning rate, which scales the pace of learning based on instantaneous Hamilton-Jacobi-Bellman error and rate of variation of Lyapunov function along the system trajectories. The augmented system states and NN weight errors are shown to possess uniform ultimate boundedness (UUB) stability under the presented update law and achieve a tighter residual set. This update law is validated on a full 6-DoF nonlinear model of UAV for attitude control.
研究の動機と目的
- 既存のオンラインIRLおよびADPフレームワークが最適追従制御において初期安定化制御器を必要としているという課題に対処すること。
- IRLに基づく最適追従制御における二重近似器(エクスキューター・キャニカル)構造を排除し、計算負荷を低減すること。
- HJB誤差とリャプノフ微分に基づく学習率適応機構を開発し、IRLに基づく最適制御における収束性向上と残差集合サイズの縮小を実現すること。
- 唯一のキャニカルニューラルネットワークを用いて、アクチュエータ制約および部分的なシステム知識のもとでも安定性とロバストネスを確保すること。
- 本手法の妥当性を、現実的な制御制約とダイナミクスを有する完全な6-DoF非線形ドローンモデルで検証すること。
提案手法
- 変動ゲイン勾配降下法を用いた新たなパrameter更新則を設計し、学習率がシステム軌道に沿ったハミルトニアン・ジョルダン・ベルマン(HJB)誤差とリャプノフ関数の変化率に応じて動的に調整されるようにした。
- 更新則に安定化項を組み込むことで、初期安定化制御器を必要としないキャニカルのみ構造におけるポリシー反復が可能になった。
- 探索フェーズを回避するオンポリシーでオンラインIRLフレームワーク内で動作し、リアルタイム適用が可能である。
- 単一のキャニカルニューラルネットワークが価値関数を近似し、従来のエクスキューター・キャニカル二重NNアーキテクチャを置き換え、計算複雑性を低減した。
- 提案された更新則の下で、拡張されたシステム状態とキャニカル重み誤差が一様最終有界性(UUB)であることが証明された。
- リグレッサー行列のランク不足を回避するため、ディザリングノイズを用いて持続的励起(persistent excitation)を維持した。
実験結果
リサーチクエスチョン
- RQ1アクチュエータ制約を伴う連続時間非線形システムに対して、初期安定化制御器を必要とせずに、キャニカルのみのIRLフレームワークが最適追従制御を達成できるか?
- RQ2HJB誤差とリャプノフ微分に基づく変動ゲイン勾配降下法は、定常学習率手法と比較して、収束性をどのように向上させ、残差集合サイズを小さくするか?
- RQ3提案された更新則の下で、拡張されたシステムの安定性挙動はいかなるものか?一様最終有界性を保証できるか?
- RQ4IRLにおける二重近似器エクスキューター・キャニカルフレームワークと比較して、キャニカルのみ構造は計算負荷をどの程度低減できるか?
- RQ5本手法は、ダイナミクスの部分的知識を持つ実世界の非線形システム、例えば6-DoFドローンにおいて、どの程度の性能を示すか?
主な発見
- 提案されたキャニカルのみのIRLフレームワークに変動ゲイン勾配降下法を組み合わせることで、拡張されたシステム状態およびキャニカル重み誤差が一様最終有界性(UUB)を達成した。
- 更新則に組み込まれた安定化項により、初期安定化制御器の必要性が明確に排除された。これは、既存のIRLおよびADP手法と比較して顕著な利点である。
- HJB誤差とリャプノフ微分に基づく変動学習率は、定常学習率手法と比較して、より狭い残差集合を実現した。
- シミュレーション結果から、キャニカルニューラルネットワークの重みが有限時間内に理想重みに近づくことが示された。
- エレベーター、ailerons、ラダーの制御入力が±90度のアクチュエータ飽和制限内に収まっており、リアルタイム実装の可能性が確認された。
- 価値関数近似誤差はほぼゼロに近づき、生成された制御方策が近似的に最適であることが示された。シミュレーションでのコストがほぼゼロであったことからも裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。