Skip to main content
QUICK REVIEW

[論文レビュー] Robust Reinforcement Learning with Wasserstein Constraint

Linfang Hou, Liang Pang|arXiv (Cornell University)|Jun 1, 2020
Adversarial Robustness in Machine Learning参考文献 26被引用数 11
ひとこと要約

本稿では、参照遷移核の周囲に Wasserstein ボールを用いて環境の動的挙動の不確実性をモデル化する Wasserstein 制約付きロバスト強化学習フレームワークを提案する。これにより、無限次元のロバスト MDP を有限次元のリスク認識問題に変換する。Wasserstein 距離の強い双対性を活用することで、遷移核の摂動と状態レベルの摂動の間の関係を確立し、環境の特徴を必要とせず理論的根拠を持つロバスト性を実現する新しい WRAAC アルゴリズムの設計を可能にする。Cart-Pole における動的摂動下での性能向上により、有効性が検証された。

ABSTRACT

Robust Reinforcement Learning aims to find the optimal policy with some extent of robustness to environmental dynamics. Existing learning algorithms usually enable the robustness through disturbing the current state or simulating environmental parameters in a heuristic way, which lack quantified robustness to the system dynamics (i.e. transition probability). To overcome this issue, we leverage Wasserstein distance to measure the disturbance to the reference transition kernel. With Wasserstein distance, we are able to connect transition kernel disturbance to the state disturbance, i.e. reduce an infinite-dimensional optimization problem to a finite-dimensional risk-aware problem. Through the derived risk-aware optimal Bellman equation, we show the existence of optimal robust policies, provide a sensitivity analysis for the perturbations, and then design a novel robust learning algorithm--Wasserstein Robust Advantage Actor-Critic algorithm (WRAAC). The effectiveness of the proposed algorithm is verified in the Cart-Pole environment.

研究の動機と目的

  • 状態やパラメータを摂動させるヒューリスティックなロバスト強化学習手法に理論的ロバスト性保証が欠如している問題に対処する。
  • Wasserstein 距離を用いて遷移確率動的挙動へのロバスト性を定量化する原理的フレームワークを構築する。
  • 強い双対性を用いて無限次元のロバスト MDP 問題を、取り扱い可能な有限次元のリスク認識 MDP に変換する。
  • 環境パラメータの事前知識を必要としない、データ駆動型で環境に依存しないロバスト強化学習アルゴリズムを設計する。
  • Cart-Pole 環境を用いて、現実世界に類似した動的摂動下での、提案手法の有効性とロバスト性を実証する。

提案手法

  • 参照遷移核を中心とする Wasserstein ベースの不確実性集合を定義し、許容される動的挙動摂動を制約する。
  • Wasserstein 距離の強い双対性を適用して、ロバスト MDP をリスク認識 MDP に再定式化し、遷移核摂動と状態レベル摂動の関係を確立する。
  • 最適方策の理論的解析と摂動への感度を可能にする、緩和されたロバストベルマン方程式を導出する。
  • リスク認識アドバンテージ推定を用いて、価値関数と方策の更新を交互に実行する二段階のアクタ・クリティック手法である WRAAC アルゴリズムを提案する。
  • Wasserstein 制約の推定にデュアル変数学習機構を用い、各状態遷移に対して λ と z をシミュレートされた動的挙動に基づいて初期化する。
  • 価値関数ネットワークと方策ネットワークに別々の学習率を用いて、確率的勾配更新を用いて方策をエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1強化学習における遷移確率動的挙動へのロバスト性を、Wasserstein 距離を用いて形式的に定量化できるか?
  • RQ2双対性を用いて、無限次元のロバスト MDP 問題を、有限次元で取り扱い可能なリスク認識 MDP に低減できるか?
  • RQ3提案手法は、システムパラメータの事前知識に依存せずに環境動的挙動へのロバスト性を達成できるか?
  • RQ4Wasserstein 不確実性集合の半径 δ に対する最適方策の感度はいかほどか?
  • RQ5WRAAC アルゴリズムは、現実世界に類似した環境における動的摂動下で、標準的な A2C よりも優れた一般化性能を示せるか?

主な発見

  • WRAAC アルゴリズムは、力の大きさの摂動(例:100 単位)下で、標準的な A2C よりも顕著に優れたロバスト性を示し、ポールの生存時間が長く保たれた。
  • ベースラインの A2C 方策は、小さな摂動下では WRAAC と同等の性能を示しており、通常状態での性能低下がロバスト性のコストとして発生していないことを示している。
  • 両方の方策が急激に劣化する 1.25 を超えるポール質量の条件下でも、ロバスト方策は安定した性能を維持しており、線形摂動では容易に捉えきれない急激な動的シフトが存在することを示唆している。
  • 実験結果は、WRAAC が環境動的挙動への本物のロバスト性を学習していることを裏付けている。これは、さまざまな動的条件下でも一貫した性能を示すことで確認された。
  • 環境パラメータの選択(例:力の大きさ vs. ポール質量)は、動的摂動の滑らかさに顕著な影響を及ぼし、力の大きさはより予測可能なロバスト性評価をもたらす。
  • WRAAC アルゴリズムは、明示的な環境特徴の特定や事前パラメータ知識を必要とせず、理論的・実験的優位性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。