Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Reward-Free Exploration

Emilie Kaufmann, Pierre Ménard|arXiv (Cornell University)|Jun 11, 2020
Advanced Bandit Algorithms Research参考文献 33被引用数 11
ひとこと要約

本稿では、最大MDP推定誤差を直接最小化することで、サンプル効率を向上させる、適応的で報酬に依存しない探索アルゴリズムであるRF-UCRLを提案する。確率 $1-\delta$ で $\varepsilon$-最適方策を探索するための、$({SAH^{4}}/{\varepsilon^{2}})(\log(1/\delta)+S)$ の改善されたサンプル複雑性を達成し、従来の手法に比べて、$\varepsilon$ や $\delta$ が小さい場合に優れた性能を示す。

ABSTRACT

Reward-free exploration is a reinforcement learning setting studied by Jin et al. (2020), who address it by running several algorithms with regret guarantees in parallel. In our work, we instead give a more natural adaptive approach for reward-free exploration which directly reduces upper bounds on the maximum MDP estimation error. We show that, interestingly, our reward-free UCRL algorithm can be seen as a variant of an algorithm of Fiechter from 1994, originally proposed for a different objective that we call best-policy identification. We prove that RF-UCRL needs of order $({SAH^4}/{\varepsilon^2})(\log(1/δ) + S)$ episodes to output, with probability $1-δ$, an $\varepsilon$-approximation of the optimal policy for any reward function. This bound improves over existing sample-complexity bounds in both the small $\varepsilon$ and the small $δ$ regimes. We further investigate the relative complexities of reward-free exploration and best-policy identification.

研究の動機と目的

  • 報酬に依存しない探索におけるより自然で適応的なアプローチの開発を目的とし、並列に複数のアルゴリズムを実行する必要を回避すること。
  • 適応的探索を通じて、最大MDP推定誤差の上界を低減すること。
  • 任意の報酬関数において $\varepsilon$-最適性を達成するための、より緊密なサンプル複雑性の境界を確立すること。
  • 報酬に依存しない探索と最良方策同定の間の関係を明確にすること。

提案手法

  • 報酬に依存しない探索を目的として再利用された、Fiechterの1994年の最良方策同定用アルゴリズムの変種としてRF-UCRLを設計する。
  • 報酬が存在しない状況において、探索と推定精度のバランスを取るために、上界信頼区間(UCB)を用いる。
  • 最良方策同定に不可欠な状態と行動に注目し、MDPモデルにおける不確実性を動的に低減するように、探索戦略を適応的に変更する。
  • 信頼区間に基づくアプローチを用いて、MDP推定精度の高確率保証を確保する。
  • 信頼区間に基づく停止基準を統合し、$\varepsilon$-最適方策が見つかった段階で探索を終了する。
  • MDPの構造とホライズン $H$ を活用して、推定誤差とサンプル複雑性のタイトな境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1複数のレグレット最小化アルゴリズムを並列に実行するのではなく、1つの適応的アルゴリズムで報酬に依存しない探索において、より優れたサンプル複雑性を達成できるか?
  • RQ2報酬に依存しない探索のサンプル複雑性は、最良方策同定のそれと比べてどう異なるか?
  • RQ3報酬信号が存在しない状況において、探索と推定誤差の最適なトレードオフは何か?
  • RQ4RF-UCRLアルゴリズムは、先行研究に比べて $\varepsilon$ や $\delta$ に依存する部分を改善して、$\varepsilon$-最適性を達成できるか?

主な発見

  • RF-UCRLは、確率 $1-\delta$ で $\varepsilon$-最適方策を出力するためのサンプル複雑性が $({SAH^{4}}/{\varepsilon^{2}})(\log(1/\delta)+S)$ のオーダーに達成される。
  • この境界は、$\varepsilon$ が小さい場合および $\delta$ が小さい場合の両方で、既存の手法を上回る。
  • RF-UCRLは、Fiechterの1994年の最良方策同定用アルゴリズムの変種であることが示され、報酬に依存しない探索と方策同定の間のより深い関係が明らかになった。
  • アルゴリズムの適応的設計により、最大MDP推定誤差の上界が直接的に低減され、よりタイトな理論的保証が得られた。
  • 分析により、目的が異なるにもかかわらず、報酬に依存しない探索と最良方策同定は、類似した根本的な複雑性を有することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。