Skip to main content
QUICK REVIEW

[論文レビュー] Provably Efficient Reinforcement Learning with Aggregated States

Shi Dong, Benjamin Van Roy|arXiv (Cornell University)|Dec 13, 2019
Reinforcement Learning in Robotics参考文献 22被引用数 12
ひとこと要約

本稿では、固定ホライズンのエピソード的MDPに対して、集約状態を用いた楽観的Q学習アルゴリズムを提案し、$\tilde{\mathcal{O}}(\sqrt{H^5MK} + \epsilon HK)$のレグレットバウンドを達成した。ここで$H$はホライズン、$M$は集約状態の数、$K$はエピソード数、$\epsilon$は各集約状態内での最適値の最大差である。このバウンドは、全状態および行動空間のサイズに依存せず、漸近的1期間あたりのレグレットが最大$\epsilon$であることを示しており、遷移ダイナミクスに構造的仮定をしない最初の結果である。

ABSTRACT

We establish that an optimistic variant of Q-learning applied to a fixed-horizon episodic Markov decision process with an aggregated state representation incurs regret $ ilde{\mathcal{O}}(\sqrt{H^5 M K} + εHK)$, where $H$ is the horizon, $M$ is the number of aggregate states, $K$ is the number of episodes, and $ε$ is the largest difference between any pair of optimal state-action values associated with a common aggregate state. Notably, this regret bound does not depend on the number of states or actions and indicates that asymptotic per-period regret is no greater than $ε$, independent of horizon. To our knowledge, this is the first such result that applies to reinforcement learning with nontrivial value function approximation without any restrictions on transition probabilities.

研究の動機と目的

  • 全状態および行動空間サイズに依存しない、状態集合約束を用いた証明可能に効率的な強化学習アルゴリズムの開発。
  • 環境の遷移ダイナミクスに構造的仮定をしないレグレットバウンドの確立。
  • 漸近的1期間あたりのレグレットが$\epsilon$で抑えられることの示唆。ここで$\epsilon$は各集約状態内での最適値の最大差である。
  • 表形式のQ学習の保証を、集約による価値関数近似に拡張し、理論的効率を維持すること。

提案手法

  • アルゴリズムは、Q値の上界信頼区間を維持する楽観的Q学習の変種を用い、訪問回数$j$に基づく$\beta / \sqrt{j}$項を用いて不確実性を組み込む。
  • 状態行動ペairを$M$個の集約状態に分割することで状態集合約束を適用し、各セル内で最適値が一定であると仮定する。
  • 段階ごとの再帰的誤差分解を用い、段階$h$でのポリシー内誤差を段階$h+1$での誤差と関連づけ、ベルマン更新の構造を活用する。
  • 推定誤差を制御するための高確率事象$\mathcal{E}_{\rm opt}$を定義し、レグレットバウンドが高確率で成立することを保証する。
  • 遷移および価値推定誤差に由来するマルティングル・差分列のバウンドに依存する。
  • コーシー・シュワルツと和の不等式を組み合わせ、$\sum_{k,h} 1/\sqrt{\hat{n}_h^k}$に基づく総レグレットのバウンドを導出し、$\tilde{\mathcal{O}}(\sqrt{H^5MK})$に至る。

実験結果

リサーチクエスチョン

  • RQ1楽観的Q学習に集約状態を適用した場合、全状態および行動空間サイズに依存しないレグレットを達成できるか?
  • RQ2環境の遷移カーネルに構造的仮定をしない場合、集約状態付きQ学習の最良の可能なレグレットバウンドは何か?
  • RQ3エージェントの性能損失は、集約状態内での最適値の最大差$\epsilon$とどのように関係するか?
  • RQ4本アルゴリズムは、先行研究で見られる$O(\epsilon H)$の損失とは異なり、$O(\epsilon)$の1期間あたりのレグレットを達成するか?

主な発見

  • 提案されたアルゴリズムは、$\tilde{\mathcal{O}}(\sqrt{H^5MK} + \epsilon HK)$のレグレットバウンドを達成し、状態数および行動数に依存しない。
  • 漸近的1期間あたりのレグレットは$\epsilon$で抑えられており、価値関数近似に起因する性能損失が最小限であり、ホライズンに比例しないことを示している。
  • 先行研究が低ランクまたは決定的遷移を仮定するのとは異なり、遷移ダイナミクスに構造的仮定を一切必要としない。
  • 解析により、訪問回数の逆平方根の和が$\tilde{\mathcal{O}}(\sqrt{H^2MK})$で抑えられることを示し、これが最終的なレグレットバウンドを導出する上で鍵となる。
  • 先行研究が$O(\epsilon H)$の1期間あたりレグレットを示すのに対し、本手法はよりタイトな$O(\epsilon)$バウンドを達成している。
  • 本バウンドは、遷移カーネルに制限がない非自明な価値関数近似を伴う強化学習で、$O\left(\epsilon\right)$の1期間あたりレグレットを達成する最初の結果である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。