Skip to main content
QUICK REVIEW

[論文レビュー] Policy Gradient Method For Robust Reinforcement Learning

Yue Wang, Shaofeng Zou|arXiv (Cornell University)|May 15, 2022
Reinforcement Learning in Robotics被引用数 10
ひとこと要約

本稿は、モデル不一致下でのロバスト強化学習に対して、グローバル最適性および計算複雑性の保証を備えた最初のポリシー勾配法を導入する。Fréchet劣勾配に基づくロバストポリシー勾配と、滑らか化されたバージョンを提案し、$Ø(\epsilon^{-3})$ の複雑性で $\epsilon$-グローバル最適解に到達する。アクタ・クリティックフレームワークへの拡張および、テーブル型およびモデルフリー設定下での理論的収束性も含む。

ABSTRACT

This paper develops the first policy gradient method with global optimality guarantee and complexity analysis for robust reinforcement learning under model mismatch. Robust reinforcement learning is to learn a policy robust to model mismatch between simulator and real environment. We first develop the robust policy (sub-)gradient, which is applicable for any differentiable parametric policy class. We show that the proposed robust policy gradient method converges to the global optimum asymptotically under direct policy parameterization. We further develop a smoothed robust policy gradient method and show that to achieve an $ε$-global optimum, the complexity is $\mathcal O(ε^{-3})$. We then extend our methodology to the general model-free setting and design the robust actor-critic method with differentiable parametric policy class and value function. We further characterize its asymptotic convergence and sample complexity under the tabular setting. Finally, we provide simulation results to demonstrate the robustness of our methods.

研究の動機と目的

  • モデル不一致下でのロバスト強化学習におけるポリシー勾配法の、証明可能なグローバル最適性およびロバスト性の保証の欠如に対処する。
  • 任意の微分可能かつリプシッツ連続なパラメトリックポリシークラスに適用可能なロバストポリシー勾配を開発する。
  • 直接ポリシーパラメータ化の下で、ポリマーク=ロジャスエヴィッチ(PL)条件を用いてグローバル最適解への漸近的収束を確立する。
  • 滑らか化されたロバストポリシー勾配法を設計し、$\epsilon$-グローバル最適解に到達するための定量的サンプル複雑性 $\mathcal{O}(\epsilon^{-3})$ を達成する。
  • 中心集合の不確実性集合からのサンプルを用いて学習する、微分可能で関数近似可能なポリシーおよび価値関数を用いたモデルフリー設定への拡張を提案し、テーブル型条件下での理論的収束保証を提供する。

提案手法

  • ロバスト価値関数のFréchet劣勾配を導出し、これは任意の微分可能かつリプシッツ連続なポリシークラスに適用可能なロバストポリシー勾配である。
  • 直接パラメトリックポリシーの下で、ロバスト価値関数がポリマーク=ロジャスエヴィッチ(PL)条件を満たすことを証明し、ポリシー勾配法のグローバル収束を可能にする。
  • 非微分性に対処するため、ロバスト価値関数の滑らか化近似を用いた滑らか化されたロバストポリシー勾配を導入し、収束速度の解析を可能にする。
  • 中心集合の不確実性集合からのサンプルを用いて学習する、微分可能で関数近似可能なポリシーおよび価値関数を用いたモデルフリーのロバストアクタ・クリティックアルゴリズムを設計する。
  • 最悪ケースMDPを定義するため、$R$-コントラミネーション不確実性集合モデルを用い、最悪の遷移カーネルに対してポリシーを最適化する。
  • 劣勾配解析、PL条件、集中不等式などの理論的道具を用いて、収束性および複雑性の上限を確立する。

実験結果

リサーチクエスチョン

  • RQ1モデル不一致下で、グローバル最適性を保証するポリシー勾配法をロバスト強化学習に開発できるか?
  • RQ2非微分可能なロバスト価値関数はどのように効果的に最適化可能か?また、達成可能な収束速度は何か?
  • RQ3滑らか化されたポリシー勾配法の、ロバスト強化学習における $\epsilon$-グローバル最適解に到達するためのサンプル複雑性は何か?
  • RQ4ロバストポリシー勾配フレームワークは、関数近似を用いたモデルフリー設定に拡張可能か?
  • RQ5提案されたロバストアクタ・クリティック法は、直接ポリシーパラメータ化の下でテーブル型設定でグローバル最適性に到達するか?

主な発見

  • 直接ポリシーパラメータ化の下で、ロバスト価値関数がポリマーク=ロジャスエヴィッチ(PL)条件を満たすため、ロバストポリシー勾配法はほとんど確実にグローバル最適解に収束する。
  • 滑らか化されたロバストポリシー勾配法は、$\mathcal{O}(\epsilon^{-3})$ のサンプル複雑性で $\epsilon$-グローバル最適解に到達する。
  • 直接ポリシーパラメータ化の下で、完全な勾配情報が得られるという仮定の下、テーブル型設定におけるロバストアクタ・クリティックアルゴリズムはグローバルに収束する。
  • Garnet問題における実験結果は、モデル不一致下での最悪ケース性能において、ロバストポリシー勾配法およびアクタ・クリティック法が非ロバストな対応手法を上回ることを示している。
  • 複数の環境および不確実性レベルにおいて、ロバストアクタ・クリティック法は、バニラアクタ・クリティック法よりも高い最悪ケースの割合割合累積報酬を達成している。
  • 理論的分析により、$R$-コントラミネーション不確実性下でのロバスト価値関数の構造が、勾配ベースの方法による安定的かつ最適なポリシー学習を支援することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。