Skip to main content
QUICK REVIEW

[論文レビュー] Online Robust Reinforcement Learning with Model Uncertainty

Yue Wang, Shaofeng Zou|arXiv (Cornell University)|Sep 29, 2021
Reinforcement Learning in Robotics参考文献 67被引用数 6
ひとこと要約

本稿では、誤ったMDPからの1つの軌道から推定される不確実性集合を用いて、モデルの不確実性に対処するオンラインのロバスト強化学習アルゴリズムを提案する。表形式の設定ではロバストQ学習を、関数近似ではロバストTDCを導入し、割引率の制約なしに漸近的に収束させ、非ロバストなアルゴリズムと同程度の収束速度を達成しながら、分布シフトに対してもロバスト性を維持する。

ABSTRACT

Robust reinforcement learning (RL) is to find a policy that optimizes the worst-case performance over an uncertainty set of MDPs. In this paper, we focus on model-free robust RL, where the uncertainty set is defined to be centering at a misspecified MDP that generates a single sample trajectory sequentially and is assumed to be unknown. We develop a sample-based approach to estimate the unknown uncertainty set and design a robust Q-learning algorithm (tabular case) and robust TDC algorithm (function approximation setting), which can be implemented in an online and incremental fashion. For the robust Q-learning algorithm, we prove that it converges to the optimal robust Q function, and for the robust TDC algorithm, we prove that it converges asymptotically to some stationary points. Unlike the results in [Roy et al., 2017], our algorithms do not need any additional conditions on the discount factor to guarantee the convergence. We further characterize the finite-time error bounds of the two algorithms and show that both the robust Q-learning and robust TDC algorithms converge as fast as their vanilla counterparts(within a constant factor). Our numerical experiments further demonstrate the robustness of our algorithms. Our approach can be readily extended to robustify many other algorithms, e.g., TD, SARSA, and other GTD algorithms.

研究の動機と目的

  • 強化学習におけるモデルの不適合による方策の劣化という課題に取り組む。
  • 誤ったMDPからの1つの軌道からオンラインで不確実性集合を推定する、モデルフリーのロバスト強化学習フレームワークを構築する。
  • 不確実性集合の事前知識を不要とすることで、大規模または高次元の環境におけるスケーラブルな展開を可能にする。
  • 先行研究とは異なり、割引率に制限的な条件を課さずにロバスト学習アルゴリズムの収束を保証する。
  • 非ロバストな対応物と同程度の定数倍要因内でスケーリングされる有限時間誤差境界を達成する。

提案手法

  • R-汚染モデルを用いて誤ったMDPの周囲に不確実性集合を定義し、敵対的遷移カーネル摂動に対してロバスト性を実現する。
  • 現在のデータのみを用いて不確実性集合を段階的に推定するオンラインでサンプルベースの推定法を設計し、追加のメモリオーバーヘッドを回避する。
  • 表形式MDP用に、滑らか化されたロバストベルマン作用素を用いてQ値を更新するロバストQ学習アルゴリズムを提案し、最適なロバストQ関数への収束を保証する。
  • 関数近似への拡張として、2段階時間スケールのロバストTDCアルゴリズムを導入し、安定な学習を実現するための滑らか化された平均二乗投影ロバストベルマン誤差(MSPRBE)を用いる。
  • 真のMDPがデータ収集に使用されたものと異なる「オフ遷移カーネル」設定に対処するための新規な滑らか化されたロバストベルマン作用素を導入する。
  • 両アルゴリズムの漸近的収束性と有限時間誤差境界を証明し、非ロバストなQ学習およびTDCと同程度の定数倍要因内で収束速度が達成されることを示す。

実験結果

リサーチクエスチョン

  • RQ1未知の不確実性集合が1つの軌道からのみ推定可能である状況において、オンラインでモデルフリーのロバスト強化学習が可能かどうか。
  • RQ2提案されたロバストQ学習アルゴリズムは、先行研究とは異なり、割引率に制限的な条件を課さずに収束するか。
  • RQ3ロバストQ学習およびロバストTDCアルゴリズムの有限時間誤差境界は、非ロバストな対応物と比較して収束速度にどの程度の要因でスケーリングされるか。
  • RQ4標準的なTD手法が発散する可能性がある状況でも、ロバストTDCアルゴリズムは関数近似下で安定性と収束性を維持できるか。
  • RQ5実験的評価を通じて、モデル不一致を伴う環境において、提案手法がどの程度のロバスト性向上を達成できるか。

主な発見

  • ロバストQ学習アルゴリズムは、Royら(2017)とは異なり、割引率にいかなる条件も課さずに最適なロバストQ関数へと漸近的に収束する。
  • ロバストQ学習の有限時間誤差境界は、非ロバストQ学習と同程度の定数倍要因内でスケーリングされ、同等の収束速度を示す。
  • ロバストTDCアルゴリズムは、漸近的に定常点へ収束し、関数近似下でも安定性を維持するが、非ロバストなTDCは発散する可能性がある。
  • 数値実験では、モデル不適合が強い状況下でロバストQ学習が非ロバストQ学習よりも著しく高い報酬を達成する。
  • ロバストTDCアルゴリズムは非ロバストTDCよりも速く収束し、安定性を保つ一方で、非ロバストTDCは同じ条件下で発散するため、関数近似におけるロバスト性の必要性が明確に示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。