Skip to main content
QUICK REVIEW

[論文レビュー] How Does an Approximate Model Help in Reinforcement Learning?

Fei Feng, Wotao Yin|arXiv (Cornell University)|Dec 6, 2019
Reinforcement Learning in Robotics参考文献 29被引用数 6
ひとこと要約

本稿では、強化学習における近似モデルが、価値に基づくプルーニングによって非最適な行動を排除することで、サンプル複雑性を低減することを確立している。本稿は、$\widetilde{O}(\overline{N}/(1-\gamma)^3\varepsilon^2)$ 個のサンプルに対するタイトな上界を提示し、$\overline{N}$ は近似モデル内の近似最適行動の数を表す。また、一致する下界を証明し、この手法の有効性が事前モデルにおける価値ギャップによってきっちり制約されることを示している。

ABSTRACT

One of the key approaches to save samples in reinforcement learning (RL) is to use knowledge from an approximate model such as its simulator. However, how much does an approximate model help to learn a near-optimal policy of the true unknown model? Despite numerous empirical studies of transfer reinforcement learning, an answer to this question is still elusive. In this paper, we study the sample complexity of RL while an approximate model of the environment is provided. For an unknown Markov decision process (MDP), we show that the approximate model can effectively reduce the complexity by eliminating sub-optimal actions from the policy searching space. In particular, we provide an algorithm that uses $\widetilde{O}(N/(1-γ)^3/\varepsilon^2)$ samples in a generative model to learn an $\varepsilon$-optimal policy, where $γ$ is the discount factor and $N$ is the number of near-optimal actions in the approximate model. This can be much smaller than the learning-from-scratch complexity $\widetildeΘ(SA/(1-γ)^3/\varepsilon^2)$, where $S$ and $A$ are the sizes of state and action spaces respectively. We also provide a lower bound showing that the above upper bound is nearly-tight if the value gap between near-optimal actions and sub-optimal actions in the approximate model is sufficiently large. Our results provide a very precise characterization of how an approximate model helps reinforcement learning when no additional assumption on the model is posed.

研究の動機と目的

  • 構造的仮定を一切行わない場合、近似モデルが強化学習におけるサンプル複雑性をどの程度低減するかを理解すること。
  • 近似モデルを用いた転移学習が顕著なサンプル効率の向上をもたらす条件を特定すること。
  • 近似モデル内の近似最適行動の数に依存するサンプル複雑性の上界と下界を確立すること。
  • 近似モデルの利点が、事前モデルにおける行動間の価値ギャップによって本質的に制限されることを示すこと。

提案手法

  • アルゴリズムは、事前モデル $\mathcal{M}_0$ を用いて、真のモデル $\mathcal{M}$ において最適である可能性のある行動(潜在的最適行動)を特定する。その際、TV距離に基づく価値類似度を用いる。
  • 探索を、これらの潜在的最適行動に限定することで、有効な行動空間とサンプル複雑性を低減する。
  • 上界は生成モデル設定と集中不等式を用いて導出され、$\overline{N}$ はすべての状態におけるこのような行動の総数を表す。
  • 下界はバンドイット文脈におけるハードインスタンスを用いて構築され、$\varepsilon$-最適性を達成するには少なくとも $\underline{N}$ 個の行動を探索する必要があることを示している。
  • 解析の根拠は、$\mathcal{M}_0$ と $\mathcal{M}$ の間のTV距離が小さいと、価値関数における $\|\cdot\|_\infty$-距離も小さいことである。
  • 実験では、航行MDP上で本手法を検証し、価値ギャップが小さい場合や $\varepsilon$ が小さい場合には、改善が限定的であることが示された。

実験結果

リサーチクエスチョン

  • RQ1近似モデルは、マークフス決定過程において $\varepsilon$-最適方策を学習する際、どの程度サンプル複雑性を低減できるか?
  • RQ2近似モデルが顕著なサンプル効率の向上を提供しない条件は何か?
  • RQ3真のモデルとのTV距離が有界な事前モデルを用いる場合、サンプル複雑性のタイトな上界と下界は何か?
  • RQ4近似モデルにおける価値ギャップは、強化学習における転移学習の有効性にどのように影響するか?

主な発見

  • 提案手法は、近似モデル内での近似最適行動数 $\overline{N}$ に依存するサンプル複雑性 $\widetilde{O}(\overline{N}/(1-\gamma)^3\varepsilon^2)$ を達成し、$\overline{N} \ll SA$ の場合に著しく複雑性を低減する。
  • 上界はほぼタイトであり、$\underline{N}$ が最小探索必要行動数を表す $\Omega(\underline{N}/(1-\gamma)^3\varepsilon^2)$ の一致する下界が確立されている。
  • 事前モデル $\mathcal{M}_0$ の価値ギャップが大きい場合、境界はほぼタイトであり、探索すべき行動数が $\overline{N}$ でよく近似される。
  • 価値ギャップが小さい場合、近似モデルの利点は薄れ、事前知識があっても学習を初期化するだけの改善に留まる。
  • 下界は生成モデルおよびオンラインRL設定の両方で成り立つため、TV距離に基づく転移学習の根本的限界を示している。
  • 航行MDPにおける実験結果は、$\varepsilon$ が小さい場合、事前知識がわずかなステップアップの改善しかもたらさないことを確認しており、理論的最悪ケース解析を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。