[論文レビュー] Improved Sample Complexity for Incremental Autonomous Exploration in MDPs
本稿では、報酬関数のないマルコフ決定過程(MDP)における段階的自己学習的探索のための新しいモデルベースのアルゴリズム、DisCoを提案する。状態発見とモデル精錬を交互に実行することで、$ otimes ilde{O}(L^5 S_{L+ε} \Gamma_{L+ε} A \varepsilon^{-2})$ のより優れたサンプル複雑性を達成し、$L$ および $ε$ の両面で先行研究を上回り、コストセンシティブな最短経路問題における $ε/c_{\min}$-最適方策を保証する。
We investigate the exploration of an unknown environment when no reward function is provided. Building on the incremental exploration setting introduced by Lim and Auer [1], we define the objective of learning the set of $ε$-optimal goal-conditioned policies attaining all states that are incrementally reachable within $L$ steps (in expectation) from a reference state $s_0$. In this paper, we introduce a novel model-based approach that interleaves discovering new states from $s_0$ and improving the accuracy of a model estimate that is used to compute goal-conditioned policies to reach newly discovered states. The resulting algorithm, DisCo, achieves a sample complexity scaling as $ ilde{O}(L^5 S_{L+ε} Γ_{L+ε} A ε^{-2})$, where $A$ is the number of actions, $S_{L+ε}$ is the number of states that are incrementally reachable from $s_0$ in $L+ε$ steps, and $Γ_{L+ε}$ is the branching factor of the dynamics over such states. This improves over the algorithm proposed in [1] in both $ε$ and $L$ at the cost of an extra $Γ_{L+ε}$ factor, which is small in most environments of interest. Furthermore, DisCo is the first algorithm that can return an $ε/c_{\min}$-optimal policy for any cost-sensitive shortest-path problem defined on the $L$-reachable states with minimum cost $c_{\min}$. Finally, we report preliminary empirical results confirming our theoretical findings.
研究の動機と目的
- 報酬信号なしの未知のMDPにおける自己学習的探索の課題に取り組み、基準状態 $s_0$ から $L$ ステップ以内に到達可能なすべての状態を発見することを目的とする。
- すべての $L$-制御可能な状態に対して $ε$-最適なゴール条件付き方策を要求することで、単に $L+\u03b5$ ステップ到達可能性にとどまらない、探索の目的を強化すること。
- 探索とモデル精度のバランスを効率的にとるモデルベースのアルゴリズムを設計し、サンプル複雑性を低減すること。
- コストセンシティブな最短経路問題の $L$-到達可能状態において、サンプル複雑性に関する理論的保証を提供するとともに、最適性を保証すること。
提案手法
- DisCoは、新しい状態の発見と遷移モデル推定の精度向上を交互に繰り返すモデルベースのアプローチを採用する。
- 現在のモデル推定値を用いてゴール条件付き方策を計算し、未訪問状態へ向かう探索を誘導する。
- 状態行動ペアの訪問回数に基づく信頼区間を用いることで、モデル推定のロバスト性を確保する。
- 新しい統合ステップを活用して方策を精錬し、$L$-到達可能状態におけるコストセンシティブな最短経路問題に対して $ε/c_{\min}$-最適性を保証する。
- 階層的な探索戦略を採用し、到達が容易な状態を優先的に処理し、次第に遠くの状態へと進む。
- モデル学習中の探索と活用のバランスを取るために、状態行動に依存する信頼区間 $ olimits\widehat{\Theta}(s,a,\mathcal{K}_k)$ を導入する。
実験結果
リサーチクエスチョン
- RQ1UCBExplore よりも優れたサンプル複雑性を達成できる、MDPにおける段階的探索のためのアルゴリズムを設計できるか?
- RQ2単に $L+\u03b5$ ステップ到達可能性にとどまらず、すべての $L$-制御可能な状態に対して $ε$-最適な方策を保証できるか?
- RQ3$L$-到達可能状態集合上で定義されたコストセンシティブな最短経路問題に対して、$ε/c_{\min}$-最適解を保証できるか?
- RQ4モデル精錬と状態発見を交互に実行することで、実際のサンプル効率が向上するか?
主な発見
- DisCoは、$\widetilde{O}(L^5 S_{L+\u03b5} \Gamma_{L+\u03b5} A \u03b5^{-2})$ のサンプル複雑性を達成し、$L$ および $\u03b5$ の両面でUCBExploreを上回るが、追加の $\Gamma_{L+\u03b5}$ 要素を伴う。
- 本アルゴリズムは、$L$-到達可能状態上で定義された任意のコストセンシティブな最短経路問題に対して、$\u03b5/c_{\min}$-最適方策を返す。これは、新たな理論的保証である。
- 曇りのチェーンおよびコンビネーションロックのドメインにおける実験結果から、DisCoはUCBExploreをサンプル効率の面で上回ることが確認された。$\u03b5=0.2$, $L=2.7$ の場合、サンプル数は30,117 (2,087) 対 90,232 (2,592) であった。
- 曇りのチェーンドメインでは、DisCoはすべての $\u03b5$ 値において最適なゴール指向方策を一貫して回復したが、UCBExploreは $\u03b5=0.1$ および $0.2$ の場合にのみそうした。
- 両ドメインにおいて、すべての時間ステップでDisCoが発見した段階的 $L$-制御可能な状態の割合は、UCBExploreを上回っており、収束が速いことが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。