[論文レビュー] ADAPT: Zero-Shot Adaptive Policy Transfer for Stochastic Dynamical Systems
AdaPT は、シミュレーションにおけるオффライン強化学習とオンラインチューブベースのモデル予測制御(MPC)を組み合わせることで、未知のダイナミクス不一致を伴う新しい物理的システムへのゼロショットで安全かつロバストな強化学習方策の転送を可能にする。状態および制御の偏差が有界であることを保証し、未モデル化された摂動下でも直接方策転送に比べて平均報酬が 50–300% よりも向上する。
Model-free policy learning has enabled robust performance of complex tasks with relatively simple algorithms. However, this simplicity comes at the cost of requiring an Oracle and arguably very poor sample complexity. This renders such methods unsuitable for physical systems. Variants of model-based methods address this problem through the use of simulators, however, this gives rise to the problem of policy transfer from simulated to the physical system. Model mismatch due to systematic parameter shift and unmodelled dynamics error may cause sub-optimal or unsafe behavior upon direct transfer. We introduce the Adaptive Policy Transfer for Stochastic Dynamics (ADAPT) algorithm that achieves provably safe and robust, dynamically-feasible zero-shot transfer of RL-policies to new domains with dynamics error. ADAPT combines the strengths of offline policy learning in a black-box source simulator with online tube-based MPC to attenuate bounded model mismatch between the source and target dynamics. ADAPT allows online transfer of policy, trained solely in a simulation offline, to a family of unknown targets without fine-tuning. We also formally show that (i) ADAPT guarantees state and control safety through state-action tubes under the assumption of Lipschitz continuity of the divergence in dynamics and, (ii) ADAPT results in a bounded loss of reward accumulation relative to a policy trained and evaluated in the source environment. We evaluate ADAPT on 2 continuous, non-holonomic simulated dynamical systems with 4 different disturbance models, and find that ADAPT performs between 50%-300% better on mean reward accrual than direct policy transfer.
研究の動機と目的
- 訓練済みのシミュレーション環境から物理的ロボットへの方策転送において、未モデル化されたダイナミクスやパrameter の不一致に直面する課題に対処すること。
- 実機ハードウェアでの危険な探索を避けるために、オンラインのファインチューニングなしにゼロショット方策転送を可能にすること。
- 有界なダイナミクス不一致下での方策転送における安全性とロバスト性を確保すること。
- ドメイン内訓練に対する状態および制御の偏差が有界であり、報酬蓄積の損失が有界であることを形式的に保証すること。
- 連続的かつ非ホロノミックなシステムにおいて、多様な摂動モデルに対して性能向上を実証すること。
提案手法
- 正確なダイナミクスを備えたブラックボックスのソースシミュレータ内で、深層強化学習方策をオフラインで訓練する。
- 摂動なしで学習済み方策をソースシミュレータで実行することで、名目的な軌道を生成する。
- ターゲットシステムのオンラインで線形化された時変動のダイナミクスモデルを用いて、名目的軌道の周囲に状態-制御チューブを構築する。
- チューブベースのモデル予測制御(MPC)を適用し、リアルタイムで方策を適応させることで、動的整合性と有界なダイナミクス不一致に対するロバスト性を確保する。
- ダイナミクス乖離のリプシッツ連続性を活用して、チューブ内での状態および制御の偏差を形式的に有界化する。
- MPCコントローラーがチューブ内でのシステム安定化を保証し、摂動下でも安全性と性能を維持すること。
実験結果
リサーチクエスチョン
- RQ1未知のダイナミクス不一致を伴う新しい物理的システムへの、形式的に安全かつロバストなゼロショット方策転送を達成できるか?
- RQ2有界なダイナミクス誤差を伴うシステム間での方策転送において、状態および制御の偏差にどのような保証を提供できるか?
- RQ3未モデル化された摂動やパrameter の不一致下で、AdaPT の性能は直接方策転送と比べてどのように異なるか?
- RQ4ターゲット環境で訓練・評価された方策と比較して、AdaPT は報酬蓄積の損失を有界に保てるか?
- RQ5非ホロノミックで連続的な力学系において、多様な摂動モデルに対して AdaPT はどのように性能を発揮するか?
主な発見
- シミュレートされた自動車およびロボットアームの環境において、4つの摂動モデルに対して、AdaPT は直接方策転送に比べて平均報酬の蓄積が 50–300% よりも向上する。
- 特にダイナミクス乖離のリプシッツ連続性という弱い仮定の下で、状態-制御チューブを通じて状態および制御の偏差が有界であることを保証する。
- ターゲット環境で専用に訓練された方策と比較して、報酬蓄積の損失が有界であることを保証する。
- 追加的な制御誤差やプロセスノイズの下では、AdaPT は直接転送を著しく上回り、より低い正規化コストと優れた追従性能を示す。
- パrameter の誤差(例えばロボットアームの質量変化)の状況では、AdaPT は直接転送と同等の性能を維持するが、不安定性や過渡応答を回避する。
- ダイナミクス不一致が有界かつリプシッツ連続であれば、ターゲットのダイナミクスが完全に把握されていなくても、本手法は有効である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。