Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning under Model Mismatch

Aurko Roy, Huan Xu|arXiv (Cornell University)|Jun 15, 2017
Reinforcement Learning in Robotics参考文献 23被引用数 10
ひとこと要約

この論文は、モデルミススペシフィケーション下でも収束する近似的最適方策を達成できるように、モデルフリー強化学習におけるロバストなQ学習、SARSA、TD学習の変種を提案することで、ロバストなマークフ・意思決定過程を拡張する。表形式および関数近似設定(線形および非線形アーキテクチャを含む)の両方で収束を確立し、新しい平均二乗ロバスト射影ベルマン誤差損失関数と確率的勾配降下法を用いる。

ABSTRACT

We study reinforcement learning under model misspecification, where we do not have access to the true environment but only to a reasonably close approximation to it. We address this problem by extending the framework of robust MDPs to the model-free Reinforcement Learning setting, where we do not have access to the model parameters, but can only sample states from it. We define robust versions of Q-learning, SARSA, and TD-learning and prove convergence to an approximately optimal robust policy and approximate value function respectively. We scale up the robust algorithms to large MDPs via function approximation and prove convergence under two different settings. We prove convergence of robust approximate policy iteration and robust approximate value iteration for linear architectures (under mild assumptions). We also define a robust loss function, the mean squared robust projected Bellman error and give stochastic gradient descent algorithms that are guaranteed to converge to a local minimum.

研究の動機と目的

  • エージェントが真の環境ではなく代理モデルから学習するモデルミススペシフィケーション下での強化学習を扱う。
  • 元々モデルベース計画に用いられるロバストMDPフレームワークを、モデルフリー強化学習設定に拡張し、モデルパラメータではなくサンプルのみにアクセス可能とする。
  • 古典的な時系列差分アルゴリズム(Q学習、SARSA、TD)のロバスト版を開発し、緩い仮定のもとで解析的収束を保証する。
  • 関数近似を用いて大規模MDPにロバストな強化学習をスケーリングし、線形および非線形アーキテクチャの両方で収束を証明する。
  • 平均二乗ロバスト射影ベルマン誤差(MSRPBE)損失関数と局所収束保証を持つ確率的勾配アルゴリズムを導入する。

提案手法

  • 推定モデルの周りの信頼領域を用いて遷移確率の不確実性を扱うロバストベルマン方程式を定義する。
  • 不確実性集合内での最悪の遷移ダイナミクスを用いて価値関数を更新するロバストQ学習、SARSA、TD学習アルゴリズムを提案する。
  • 関数近似のための損失関数として、MSRPBE(平均二乗ロバスト射影ベルマン誤差)を導入し、ロバスト設定に一般化されたMSPBEを拡張する。
  • MSRPBEを最小化するための確率的勾配降下法アルゴリズムを開発し、滑らかさと緩い仮定のもとで局所最小値への収束保証を付与する。
  • 滑らかさと類似した技術的仮定のもとで、線形関数近似器を用いたロバストな近似方策および価値反復の収束を証明する。
  • 実験では10分割交差検証とラインサーチを用いて、不確実性集合(信頼領域)のサイズをチューニングする。

実験結果

リサーチクエスチョン

  • RQ1サンプルのみが利用可能でモデルパラメータが入手できないモデルフリー設定において、ロバストな強化学習アルゴリズムを開発できるか?
  • RQ2Q学習、SARSA、TD学習のロバスト版は、モデルミススペシフィケーション下でも近似的最適方策に収束するか?
  • RQ3線形関数近似を用いたロバストな近似方策および価値反復は、不確実性下でも良い解に収束するか?
  • RQ4MSPBEを一般化し、非線形関数近似設定でも収束を可能にするロバストな損失関数は存在するか?
  • RQ5実際の応用において、不確実性集合のサイズはロバストな強化学習アルゴリズムの性能にどのように影響するか?

主な発見

  • 緩い割引率仮定のもとで、モデルミススペシフィケーション下でもロバストQ学習、SARSA、TD学習は近似的最適方策に収束する。
  • ノーマルなアルゴリズム(標準的Q学習など)は、モデルミススペシフィケーション下で最適なロバスト方策よりも任意に悪い方策に収束する可能性がある。
  • 線形関数近似器を用いたロバストな近似方策および価値反復は、先行研究と類似した技術的仮定のもとで収束する。
  • 提案されたMSRPBE損失関数はロバスト最適方策を局所最小値として持ち、任意の滑らかな関数近似器に対して確率的勾配降下法が局所最小値に収束する。
  • 実験結果では、特に小さなから中程度のモデル摂動下で、ロバストなアルゴリズムが累積報酬および尾部分布の観点でノーマルなアルゴリズムを上回ることが示された。
  • 収束境界におけるβの増加に伴い、有効な確率分布の単体を越えて不確実性集合が拡大すると性能が劣化する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。