Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Regret Bounds for Selecting the State Representation in Reinforcement Learning

Odalric-Ambrym Maillard, Phuong Nguyen|arXiv (Cornell University)|Feb 11, 2013
Reinforcement Learning in Robotics参考文献 14被引用数 20
ひとこと要約

本稿では、一部のモデルのみがマルコフ決定過程(MDP)を生成する場合でも、有限個の候補モデルの中から最適な状態表現を選択できる強化学習アルゴリズムであるOMS(Optimistic Model Selection)を提案する。不確実性の面前での楽観主義を活用することで、$O(\sqrt{|Φ|T})$ のレグレットバウンドを達成し、$T$ に関して最適であり、先行研究で見られる指数関数的加法項を回避する。これは、1つのMDPで学習する際の最良の既知のレグレットと一致する。

ABSTRACT

We consider an agent interacting with an environment in a single stream of actions, observations, and rewards, with no reset. This process is not assumed to be a Markov Decision Process (MDP). Rather, the agent has several representations (mapping histories of past interactions to a discrete state space) of the environment with unknown dynamics, only some of which result in an MDP. The goal is to minimize the average regret criterion against an agent who knows an MDP representation giving the highest optimal reward, and acts optimally in it. Recent regret bounds for this setting are of order $O(T^{2/3})$ with an additive term constant yet exponential in some characteristics of the optimal MDP. We propose an algorithm whose regret after $T$ time steps is $O(\sqrt{T})$, with all constants reasonably small. This is optimal in $T$ since $O(\sqrt{T})$ is the optimal regret in the setting of learning in a (single discrete) MDP.

研究の動機と目的

  • 有限個の候補モデルの中から、マルコフ的ダイナミクスを生成するモデルが一部である場合に、最良の状態表現を選択する学習アルゴリズムを開発すること。
  • 正しくないモデルが事前に不明な場合でも、1つのMDPで学習する際に知られている最良の $O(\sqrt{T})$ レグレットバウンドと一致する性能を達成すること。
  • 先行手法(例:BLB)が最適モデルのMDP直径に依存する指数的加法項を含むレグレットバウンドに悩まされるのを回避すること。
  • MDP性の仮説検定に高コストがかかるのを避ける代わりに、各モデル間での楽観的探索を用いる理論的に妥当で実用的なアルゴリズムを提供すること。

提案手法

  • OMSは楽観的モデル選択の原則を用い、現在の推定に基づいて最高の潜在的報酬を promise するモデルを優遇する。
  • アルゴリズムは各モデルの期待報酬について信頼区間を維持し、各ステップで上側信頼限界が最大のモデルを選択する。
  • 選択されたモデル内では、UCRL2の変種を用いてポリシーを学習し、遷移および報酬ダイナミクスを推定する。
  • 蓄積された報酬に関する統計的検定を通じて、非マルコフ的モデルを動的に除外することで、高い潜在的価値を持つモデルのみを保持する。
  • エピソードベースの学習を採用し、状態行動ペアへの訪問回数が2倍になるか、報酬の一貫性テストに失敗した場合に終了条件を設定する。
  • レグレット解析では、エピソード数と信頼区間の成長に関するバウンドを組み合わせ、濃度不等式とエピソード数の対数的バウンドを活用する。

実験結果

リサーチクエスチョン

  • RQ1一部のモデルしかマルコフ的でない場合でも、有限個のモデルの中から最適な状態表現を選択するアルゴリズムが $O(\sqrt{T})$ のレグレットを達成できるか?
  • RQ2最適モデルのMDP直径に依存する指数的加法項を含まないレグレットバウンドを達成することは可能か?
  • RQ3楽観主義に基づくモデル選択は、理論的保証を維持しながら、均一な探索に比べてレグレット性能を上回れるか?
  • RQ4この設定において、候補モデル数 $|\Phi|$ との最適な依存関係は何か?
  • RQ5近接性の概念を用いて、無限または連続的なモデル族へアルゴリズムを拡張可能か?

主な発見

  • OMSは、すべての定数が適切に小さい $O(\sqrt{|Φ|T})$ のレグレットバウンドを達成し、$T$ に関して最適であり、1つのMDPで学習する際の最良の既知のレグレットと一致する。
  • レグレットバウンドには、最適モデルのMDP直径に依存する指数的加法項が含まれない。これは、BLBなどの先行手法とは異なり、好ましい性質である。
  • 高確率($1 - \delta$)で、最適なマルコフモデルが学習中に除外されず、非マルコフ的モデルは報酬の一貫性に基づいて除外される。
  • エピソード数 $K_T$ は $O(SA \log T + |\Phi|)$ で有界であり、これが全体のレグレットバウンドにおける対数的依存性に寄与する。
  • 解析により、レグレットは $\sqrt{|Φ|T}$ に比例し、この $|\Phi|$ への依存は最適であると推測されるが、まだ証明されていない。
  • レグレットの $T$ への依存性において、OMSはBLBを上回り、$T^{2/3}$ のスケーリングを回避する。これは $√{T}$ に比べて劣化したスケーリングである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。