Skip to main content
QUICK REVIEW

[论文解读] On Optimistic versus Randomized Exploration in Reinforcement Learning

Ian Osband, Benjamin Van Roy|arXiv (Cornell University)|Jun 13, 2017
Evolutionary Algorithms and Applications参考文献 2被引用 9
一句话总结

本文比较了强化学习中乐观探索与随机探索的差异,表明随机方法(如Thompson采样)通过基于后验概率分配探索,实现了更优的统计效率。相比之下,标准的乐观方法由于不确定性量化不一致,尤其在状态空间扩展时,牺牲了统计效率,尽管其计算上是可行的。

ABSTRACT

We discuss the relative merits of optimistic and randomized approaches to exploration in reinforcement learning. Optimistic approaches presented in the literature apply an optimistic boost to the value estimate at each state-action pair and select actions that are greedy with respect to the resulting optimistic value function. Randomized approaches sample from among statistically plausible value functions and select actions that are greedy with respect to the random sample. Prior computational experience suggests that randomized approaches can lead to far more statistically efficient learning. We present two simple analytic examples that elucidate why this is the case. In principle, there should be optimistic approaches that fare well relative to randomized approaches, but that would require intractable computation. Optimistic approaches that have been proposed in the literature sacrifice statistical efficiency for the sake of computational efficiency. Randomized approaches, on the other hand, may enable simultaneous statistical and computational efficiency.

研究动机与目标

  • 分析强化学习中乐观探索与随机探索的相对统计效率。
  • 识别尽管理论基础相似,为何随机方法在实践中通常优于乐观方法。
  • 揭示常见乐观探索方法在状态空间扩展下因不确定性量化不一致而存在的缺陷。
  • 论证尽管理论上存在最优的乐观方法,但其计算上不可行,因此随机方法在实际中更具可行性和效率。

提出的方法

  • 作者使用两个分析性案例比较探索策略:一个涉及具有二元动作的有限horizon MDP,另一个具有分支状状态转移结构。
  • 对于乐观探索,他们应用标准的‘面对不确定性时的乐观性’(OFU)原则,通过固定的乐观参数c提升价值估计。
  • 对于随机探索,他们从MDP的后验分布中采样一个价值函数,并基于采样函数贪婪地行动,以模拟Thompson采样。
  • 通过分析探索决策在状态空间规模变化(如后继状态数量)下是否保持一致,来评估决策一致性。
  • 比较两种方法选择探索动作的条件,重点关注不确定性(标准差)与价值差异之间的相互作用。
  • 他们证明,随机方法能自然地在规模变化下保持一致性,而乐观方法因平均标准差而非方差而失效。

实验结果

研究问题

  • RQ1为何像PSRL这样的随机探索方法在实践中常优于像UCRL2这样的乐观方法,尽管两者具有相似的理论保证?
  • RQ2状态空间扩展如何影响乐观与随机方法在探索决策一致性方面的影响?
  • RQ3能否在不牺牲计算可行性的情况下,使乐观探索具备统计效率?
  • RQ4后验采样在不同不确定性尺度下维持决策一致性方面起到何种作用?

主要发现

  • 通过后验采样实现的随机探索在状态空间扩展下能保持决策一致性,而乐观方法则不能。
  • 那些对可能的后继状态平均标准差的乐观方法在扩展时无法保持一致性,导致在后继状态数量增加时产生错误的探索决策。
  • 在分支状转移示例中,典型的乐观方法仅在cε√N > 1时才会探索,该条件依赖于N,而随机方法的探索概率与N无关,更真实地反映了不确定性。
  • 性能差距的根源在于,乐观方法施加了一个与√N成比例的不一致提升,而正确的不确定性缩放应基于方差而非标准差。
  • 尽管理论上可实现最优一致性的乐观方法存在,但其计算上不可行,因此随机方法在真实强化学习中更具实用性。
  • PSRL与UCRL2在RiverSwim上的实验结果表明,随机探索能实现更快的学习速度和更低的遗憾,验证了理论优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。