Skip to main content
QUICK REVIEW

[论文解读] Navigating to the Best Policy in Markov Decision Processes

Aymen Al Marjani, Aurélien Garivier|arXiv (Cornell University)|Jun 5, 2021
Reinforcement Learning in Robotics参考文献 40被引用 4
一句话总结

该论文提出了 MDP-NaS,这是首个在在线导航约束下对马尔可夫决策过程(MDP)进行最优策略识别的算法,其中状态转移是按顺序观测而非查询获得的。该工作建立了问题相关的下界,并证明了实例特定的样本复杂度,其收敛速率取决于 MDP 的遍历性,通过一种新颖的采样规则,结合均匀策略与插补策略,利用非时齐马尔可夫链的遍历定理来追踪最优状态-动作频率。

ABSTRACT

We investigate the classical active pure exploration problem in Markov Decision Processes, where the agent sequentially selects actions and, from the resulting system trajectory, aims at identifying the best policy as fast as possible. We propose a problem-dependent lower bound on the average number of steps required before a correct answer can be given with probability at least $1-δ$. We further provide the first algorithm with an instance-specific sample complexity in this setting. This algorithm addresses the general case of communicating MDPs; we also propose a variant with a reduced exploration rate (and hence faster convergence) under an additional ergodicity assumption. This work extends previous results relative to the \emph{generative setting}~\cite{pmlr-v139-marjani21a}, where the agent could at each step query the random outcome of any (state, action) pair. In contrast, we show here how to deal with the \emph{navigation constraints}, induced by the \emph{online setting}. Our analysis relies on an ergodic theorem for non-homogeneous Markov chains which we consider of wide interest in the analysis of Markov Decision Processes.

研究动机与目标

  • 解决在无限时域折扣 MDP 中,通过自然转移由动作决定下一状态的在线、顺序观测约束下的最优策略识别(BPI)问题。
  • 推导在以至少 $1 - \delta$ 的概率正确识别策略时,期望停止时间的问题依赖下界。
  • 设计一种在在线设置下具有实例特定样本复杂度的算法,克服以往基于生成模型假设的局限性。
  • 分析在不同 MDP 通信结构(如遍历性与仅连通性)下,保证对极小化器策略一致估计所需的最小强制探索率。
  • 利用针对非时齐马尔可夫链的新型遍历定理,建立理论保证,确保采样频率收敛至目标极小化器分配。

提出的方法

  • 通过将 [MP21] 中的信息论下界适配到在线设置,将算法策略集限制为 $\Omega(\mathcal{M})$,以反映导航约束的影响。
  • 提出 MDP-NaS,一种采样规则,将均匀策略与极小化器策略的插补估计混合,以确保状态-动作频率收敛至最优分配 $\omega^\star$。
  • 利用非时齐马尔可夫链框架,证明在所提规则下,采样频率 $N_{sa}(t)/t$ 收敛至 $\omega^\star$,其理论基础是针对此类链的新型遍历定理。
  • 证明在遍历 MDP 中,$1/\sqrt{t}$ 的缓慢探索率已足够保证一致性;而在仅连通 MDP 中,则需要更慢的 $t^{-1/(m+1)}$ 探索率,其中 $m$ 与 MDP 的结构相关。
  • 利用马尔可夫链的扰动界,将转移核的偏差与平稳分布的偏差关联,确保插补策略估计器的鲁棒性。
  • 应用泊松方程技术,界定平稳分布对模型扰动的敏感性,从而实现对采样规则的稳定性分析。

实验结果

研究问题

  • RQ1当从生成模型设置转移到在线导航设置时,最优策略识别的样本复杂度如何变化?
  • RQ2在在线 MDP 设置中,以至少 $1 - \delta$ 的概率识别 $\varepsilon$-最优策略时,期望停止时间的问题依赖下界是什么?
  • RQ3能否设计一种采样规则,确保在顺序且不可查询的转移下,状态-动作采样频率收敛至极小化器分配 $\omega^\star$?
  • RQ4在连通 MDP 中,为保证插补策略估计器的一致性,所需的最小强制探索率是多少?
  • RQ5MDP 的遍历性如何影响算法所需的探索率和收敛速度?

主要发现

  • 该论文建立了在线 MDP 中最优策略识别的期望停止时间的问题依赖下界,扩展了先前在生成模型设置下的结果。
  • MDP-NaS 在 $\delta \to 0$ 的渐近范围内实现了实例特定的样本复杂度,这是首次在在线导航设置中获得此类保证。
  • 在遍历 MDP 中,仅需 $1/\sqrt{t}$ 的强制探索率即可保证插补估计器的一致性,显著快于一般连通情形。
  • 对于一般连通 MDP,需要更慢的探索率 $t^{-1/(m+1)}$,其中 $m$ 是 MDP 的结构参数,在最坏情况下可达到 $S-1$ 的量级。
  • 通过针对非时齐马尔可夫链的新型遍历定理,证明了采样频率收敛至 $\omega^\star$,该定理本身在 MDP 分析中具有独立兴趣。
  • 分析表明,平稳分布对模型扰动的敏感性受仅依赖于 MDP 的常数 $\kappa_{\mathcal{M}}$ 有界,从而支持稳健的策略估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。