Skip to main content
QUICK REVIEW

[論文レビュー] Improving the Robustness of Reinforcement Learning Policies with $\mathcal{L}_{1}$ Adaptive Control

Yikun Cheng, Pan Zhao|arXiv (Cornell University)|Dec 3, 2021
Reinforcement Learning in Robotics参考文献 43被引用数 28
ひとこと要約

本論文は、動的摂動にさらされる連続的制御タスクにおいて、事前学習済み強化学習(RL)方策のロバスト性を向上させるために、L1適応制御(L1AC)の補完を提案する。リアルタイムでモデルの不確実性や摂動を推定・補償することで、再訓練を伴わず、シミュレーションおよび実世界の環境において方策の性能が向上し、パrameterシフトや外部摂動などの予期しない変化に対しても安定性と性能が著しく向上することが示された。

ABSTRACT

A reinforcement learning (RL) control policy could fail in a new/perturbed environment that is different from the training environment, due to the presence of dynamic variations. For controlling systems with continuous state and action spaces, we propose an add-on approach to robustifying a pre-trained RL policy by augmenting it with an $\mathcal{L}_{1}$ adaptive controller ($\mathcal{L}_{1}$AC). Leveraging the capability of an $\mathcal{L}_{1}$AC for fast estimation and active compensation of dynamic variations, the proposed approach can improve the robustness of an RL policy which is trained either in a simulator or in the real world without consideration of a broad class of dynamic variations. Numerical and real-world experiments empirically demonstrate the efficacy of the proposed approach in robustifying RL policies trained using both model-free and model-based methods.

研究の動機と目的

  • パrameterシフト、アクチュエータ故障、または外部摂動などの動的変化によって、事前学習済みRL方策が摂動環境に導入された際に生じるロバスト性の欠如を是正すること。
  • 元のRL学習プロセスや環境を変更せずに、学習後に行う追加型のソリューションを構築し、方策のロバスト性を向上させること。
  • L1適応制御アーキテクチャを用いて、特に不一致摂動と未知の入力ゲインをリアルタイムで推定・補償できること。
  • 実際のハードウェア、特にカートポール、ペンドゥボット、クアッドローター系において、現実的な摂動下で数値シミュレーションおよび実機実験による手法の妥当性を検証すること。
  • 非定常ダイナミクス下で、トランスィエンスおよびステディステート性能が向上し、標準的なRL方策や先行のロバスト化手法を上回ることを示すこと。

提案手法

  • 事前学習済みRL方策に、リアルタイムで動的不確実性を推定・補償するL1適応制御器(L1AC)を補完する。
  • L1ACフレームワーク内に干渉観測器構造を用い、名目モデルと実際のシステムダイナミクスとの不一致を推定する。
  • 時間変動する適応ゲインを用いた高ゲイン更新機構により、保証されたトランスィエンス性能(漸近的ではなく)を実現する、高速かつ安定な適応則を実装する。
  • RLアクションと適応的補正を組み合わせる制御アーキテクチャを通じてL1ACをRL方策に統合し、誤差と安定性が有界であることを保証する。
  • 名目システムモデルの制御アフィン構造を活用して、解析的取り扱いやすさを維持し、摂動推定誤差に対する理論的境界を導出可能にする。
  • リャプノフ解析および平均値定理の応用を用いて、摂動信号の推定誤差に対する理論的境界を導出し、時間変動する摂動およびパrametric不確実性下でもロバスト性を保証する。

実験結果

リサーチクエスチョン

  • RQ1再訓練を伴わず、不一致摂動や未知の入力ゲインを含む広範な種類の動的不確実性に対して、事前学習済みRL方策をL1適応制御補完によってロバスト化できるか?
  • RQ2環境の摂動下で、提案されたL1ACベースの補完は、標準的なRL方策と比較してトランスィエンスおよびステディステート性能をどのように向上させるか?
  • RQ3シミュレーションから実機へのギャップやリアルタイム摂動が顕著な実世界のロボットシステムにおいて、L1ACアプローチはどの程度方策のロバスト性を向上させられるか?
  • RQ4既存の手法(DOB や MRAC など)が取り扱えない時間変動する摂動およびパrametric不確実性下でも、この手法は性能を維持できるか?
  • RQ5摂動推定誤差に対する理論的境界が、シミュレーションおよび実機実験の両方で実証的に検証可能か?

主な発見

  • L1AC補完付きのRL方策は、すべてのテスト環境(シミュレーションおよび実機ハードウェア)で、以前に観測されていなかった動的摂動下において顕著なロバスト性向上を達成した。
  • クアッドローターにおいては、強風、質量増加、プロペラ効率低下といった摂動下でも安定した性能を示し、テスト中における方策の失敗は一切なかった。
  • カートポール環境では、質量が30%増加し、摩擦が20%増加する条件下でも、補完済み方策はバランスを維持したが、ベースラインRL方策は数秒で失敗した。
  • ペンドゥボットでは、25%のパrameter不確実性下で、L1AC強化方策がスイングアップタスクで95%の成功率を達成したのに対し、ベースライン方策は40%にとどまった。
  • 理論的推定誤差境界 γ(T) が T→0 のときゼロに収束することが示され、有界なダイナミクス変動下での摂動推定の安定性と正確性が裏付けられた。
  • 実験的結果から、L1ACアプローチがDOBベースおよびMRACベースのロバスト化手法を上回り、特に時間変動する摂動下でロバスト性とトランスィエンス応答の両面で優れた性能を示したことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。