Skip to main content
QUICK REVIEW

[论文解读] Optimal Regret Bounds for Selecting the State Representation in Reinforcement Learning

Odalric-Ambrym Maillard, Phuong Nguyen|arXiv (Cornell University)|Feb 11, 2013
Reinforcement Learning in Robotics参考文献 14被引用 20
一句话总结

该论文提出 OMS(乐观模型选择),一种强化学习算法,可在仅部分候选模型生成马尔可夫决策过程(MDPs)的情况下,从有限个候选模型中选择最优状态表示。通过在不确定性面前采取乐观策略,OMS 实现了 $O(\sqrt{|Φ|T})$ 的遗憾界,该界在 $T$ 上是最优的,且避免了先前方法中存在的指数级加法项,与单个 MDP 学习的最佳已知遗憾界一致。

ABSTRACT

We consider an agent interacting with an environment in a single stream of actions, observations, and rewards, with no reset. This process is not assumed to be a Markov Decision Process (MDP). Rather, the agent has several representations (mapping histories of past interactions to a discrete state space) of the environment with unknown dynamics, only some of which result in an MDP. The goal is to minimize the average regret criterion against an agent who knows an MDP representation giving the highest optimal reward, and acts optimally in it. Recent regret bounds for this setting are of order $O(T^{2/3})$ with an additive term constant yet exponential in some characteristics of the optimal MDP. We propose an algorithm whose regret after $T$ time steps is $O(\sqrt{T})$, with all constants reasonably small. This is optimal in $T$ since $O(\sqrt{T})$ is the optimal regret in the setting of learning in a (single discrete) MDP.

研究动机与目标

  • 开发一种学习算法,从有限个候选模型中选择最优状态表示,其中仅部分模型能产生马尔可夫动力学。
  • 实现与单个 MDP 学习中已知的最优 $O(\sqrt{T})$ 遗憾界相匹配的遗憾性能,即使在最优模型事先未知的情况下亦可。
  • 消除先前方法(如 BLB)中依赖于最优模型 MDP 直径的遗憾界中的指数级加法项。
  • 提供一种理论坚实且实用的算法,通过在模型间采用乐观探索而非对 MDP 性质进行昂贵的假设检验,避免对 MDP 性质的逐一测试。

提出的方法

  • OMS 使用乐观模型选择原则,优先选择基于当前估计能带来最高潜在回报的模型。
  • 该算法为每个模型维护期望回报的置信区间,并在每一步选择上界置信度最高的模型。
  • 在每个选定模型内,采用 UCRL2 算法的变体来学习策略并估计转移与奖励动力学。
  • 通过累积奖励上的统计检验,动态剪枝非马尔可夫模型,确保仅保留具有高潜力的模型。
  • 采用基于状态-动作对访问次数翻倍或奖励一致性检验失败的终止条件的分段学习机制。
  • 遗憾分析结合了对分段数量和置信区间增长的界,利用集中不等式和对分段数量的对数界。

实验结果

研究问题

  • RQ1能否设计一种算法,在从有限个模型中选择最优状态表示时,实现 $O(\sqrt{T})$ 的遗憾界,即使仅部分模型为马尔可夫性?
  • RQ2是否可能避免依赖于最优模型 MDP 直径的遗憾界中的指数级加法项?
  • RQ3基于乐观性的模型选择能否在保持理论保证的同时,优于均匀探索的遗憾表现?
  • RQ4在此类设置下,遗憾界对候选模型数量 $|\Phi|$ 的最优依赖关系是什么?
  • RQ5该算法能否扩展至无限或连续的模型族,并引入对马尔可夫动力学接近度的概念?

主要发现

  • OMS 实现了 $O(\sqrt{|Φ|T})$ 的遗憾界,且所有常数均合理适中,该界在 $T$ 上是最优的,与单个 MDP 学习的最佳已知遗憾界一致。
  • 该遗憾界不包含对最优模型 MDP 直径的指数级加法项,与先前方法(如 BLB)不同。
  • 该算法以高概率($1 - \delta$)确保最优马尔可夫模型在学习过程中不会被剔除,而非马尔可夫模型则基于奖励一致性被剪枝。
  • 分段数 $K_T$ 的上界为 $O(SA \log T + |\Phi|)$,这有助于遗憾界整体呈现对数依赖性。
  • 分析表明,遗憾界随 $\sqrt{|Φ|T}$ 增长,且对 $|\Phi|$ 的依赖关系被推测为最优,尽管尚未严格证明。
  • 与 BLB 相比,该方法在 $T$ 上的遗憾依赖关系更优,避免了次优的 $T^{2/3}$ 刻画,而 $\sqrt{T}$ 是更优的尺度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。