[論文レビュー] Navigating to the Best Policy in Markov Decision Processes
本稿では、遷移をクエリではなく逐次観測するオンラインナビゲーション制約下におけるマルコフ決定過程(MDP)における最良方策同定のための最初のアルゴリズム、MDP-NaSを提案する。問題依存の下界を確立し、MDPの定常性に依存する収束速度を持つインスタンス固有のサンプル複雑性を証明する。非一様かつプラグイン方策を混合する新しいサンプリングルールを用い、非時定型マルコフ連鎖の定常性定理を応用して最適状態行動頻度を追跡する。
We investigate the classical active pure exploration problem in Markov Decision Processes, where the agent sequentially selects actions and, from the resulting system trajectory, aims at identifying the best policy as fast as possible. We propose a problem-dependent lower bound on the average number of steps required before a correct answer can be given with probability at least $1-δ$. We further provide the first algorithm with an instance-specific sample complexity in this setting. This algorithm addresses the general case of communicating MDPs; we also propose a variant with a reduced exploration rate (and hence faster convergence) under an additional ergodicity assumption. This work extends previous results relative to the \emph{generative setting}~\cite{pmlr-v139-marjani21a}, where the agent could at each step query the random outcome of any (state, action) pair. In contrast, we show here how to deal with the \emph{navigation constraints}, induced by the \emph{online setting}. Our analysis relies on an ergodic theorem for non-homogeneous Markov chains which we consider of wide interest in the analysis of Markov Decision Processes.
研究の動機と目的
- 無限時 horizon 割合割引 MDP における最良方策同定(BPI)問題を、自然な遷移により次の状態が決定されるオンラインで逐次観測可能な制約下で取り扱う。
- 確率 $1 - \delta$ 以上で正しい方策を同定するための期待停止時刻に対する問題依存の下界を導出する。
- 従来の生成モデル仮定の制限を克服するオンライン設定におけるインスタンス固有のサンプル複雑性を持つアルゴリズムを設計する。
- 異なるMDP通信構造(例:定常的 vs. 僅かに通信可能)におけるオラクル方策の一貫性推定に必要な最小強制的探索レートを特定する。
- 非時定型マルコフ連鎖に対する新しい定常性定理を用いて、サンプリング頻度がターゲットオラクル割り当てに収束することを保証する理論的保証を確立する。
提案手法
- ナビゲーション制約を反映するために、[MP21] の情報理論的下界をオンライン設定に適応し、アルゴリズムの戦略集合を $\Omega(\mathcal{M})$ に制限する。
- 最適割り当て $\omega^\star$ への状態行動頻度の収束を保証するため、一様方策とオラクル方策のプラグイン推定値を混合するMDP-NaSというサンプリングルールを提案する。
- 非時定型マルコフ連鎖の枠組みを用いて、提案されたルールのもとでサンプリング頻度 $N_{sa}(t)/t$ が $\omega^\star$ に収束することを証明し、その根拠としてこのような連鎖に対する新しい定常性定理を用いる。
- 定常MDPでは、$1/\sqrt{t}$ のようなゆっくりとした探索レートで一貫性が達成可能であるのに対し、僅かに通信可能なMDPでは $t^{-1/(m+1)}$ のより遅いレートが必要であることが示され、$m$ はMDPの構造に関連するパラメータである。
- マルコフ連鎖の摂動バウンドを用いて、遷移核の摂動と定常分布の摂動との関係を関係づけ、プラグイン方策推定器のロバスト性を保証する。
- ポisson方程式の技術を用いて、モデル摂動に対する定常分布の感度をバウンドし、サンプリングルールの安定性解析を可能にする。
実験結果
リサーチクエスチョン
- RQ1生成モデルからオンラインナビゲーション設定に移行した場合、最良方策同定のサンプル複雑性はどのように変化するか?
- RQ2オンラインMDP設定において、確率 $1 - \delta$ 以上で $\varepsilon$-最適方策を同定するための期待停止時刻に対する問題依存の下界は何か?
- RQ3逐次的でクエリ不能な遷移のもとで、状態行動のサンプリング頻度がオラクル割り当て $\omega^\star$ に収束するようなサンプリングルールを設計できるか?
- RQ4通信可能MDPにおけるプラグイン方策推定器の一貫性を保証するために必要な最小強制的探索レートは何か?
- RQ5MDPの定常性が、必要となる探索レートとアルゴリズムの収束速度にどのように影響するか?
主な発見
- 本稿では、オンラインMDPにおけるBPIの期待停止時刻に対する問題依存の下界を確立し、生成モデル設定からの先行結果を拡張する。
- MDP-NaSは、$\delta \to 0$ の漸近的状態において、オンラインナビゲーション設定で初めてのインスタンス固有のサンプル複雑性を達成する。
- 定常MDPでは、$1/\sqrt{t}$ のような非常に遅い探索レートでも、プラグイン推定器の一貫性が達成可能であり、一般の通信可能ケースよりもはるかに速い。
- 一般の通信可能MDPでは、$t^{-1/(m+1)}$ のより遅い探索レートが必要であり、$m$ はMDPの構造的パラメータであり、最悪の場合 $S-1$ にまで拡大しうる。
- サンプリング頻度が $\omega^\star$ に収束することは、非時定型マルコフ連鎖に対する新しい定常性定理を用いて証明され、MDP解析において独立に価値ある結果である。
- 解析により、定常分布のモデル摂動に対する感度が、MDPにのみ依存する定数 $\kappa_{\mathcal{M}}$ でバウンドされることを示し、ロバストな方策推定が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。