Skip to main content
QUICK REVIEW

[论文解读] Worst-Case Regret Bounds for Exploration via Randomized Value Functions

Daniel Russo|arXiv (Cornell University)|Jun 7, 2019
Advanced Bandit Algorithms Research参考文献 27被引用 16
一句话总结

该论文提出随机化最小二乘值迭代(RLSVI),通过向训练数据注入高斯噪声,生成用于表格型有限horizon MDP中探索的随机化值函数。该工作首次为该方法建立了最坏情况下的遗憾边界,证明在一般条件下遗憾呈多项式增长,从而为ε-greedy和Boltzmann探索提供了理论坚实且实用的替代方案。

ABSTRACT

This paper studies a recent proposal to use randomized value functions to drive exploration in reinforcement learning. These randomized value functions are generated by injecting random noise into the training data, making the approach compatible with many popular methods for estimating parameterized value functions. By providing a worst-case regret bound for tabular finite-horizon Markov decision processes, we show that planning with respect to these randomized value functions can induce provably efficient exploration.

研究动机与目标

  • 开发一种与实际值函数学习算法兼容的、具有理论基础的探索方法。
  • 解决如ε-greedy和Boltzmann探索等简单探索策略在简单MDP中可能失效的局限性。
  • 为一种通过使用随机化值函数进行规划来生成探索的RLSVI方法,提供最坏情况下的遗憾边界。
  • 建立RLSVI的频率学分析,避免依赖贝叶斯先验或后验抽样。
  • 扩展已知在表格型MDP中满足多项式最坏情况遗憾边界的探索算法集合。

提出的方法

  • RLSVI通过在最小二乘策略迭代过程中向奖励和转移概率估计值注入独立的高斯噪声,生成随机化值函数。
  • 该方法使用一个带有噪声奖励 $\hat{R}^k + w^k$ 和估计转移概率 $\hat{P}^k$ 的扰动MDP模型 $\overline{M}^k$,其中 $w^k$ 为独立同分布的高斯噪声。
  • 探索通过基于随机化值函数 $V(\overline{M}^k, \pi^k)$ 的规划来驱动,其中 $\pi^k$ 是扰动MDP中的最优策略。
  • 一个关键技术步骤表明,每次采样的值函数都有恒定概率是乐观的,从而可通过集中不等式进行遗憾分析。
  • 分析使用扰动MDP的虚构独立副本 $\tilde{M}^k$ 来解耦策略选择与估计误差,从而能够对期望遗憾差异进行上界估计。
  • 该证明依赖于文献[13]中的最大不等式和集中不等式,应用于奖励和转移的概率估计误差的值函数和误差上。

实验结果

研究问题

  • RQ1通过在训练数据中注入噪声生成的随机化值函数,能否在表格型MDP中提供可证明高效的探索?
  • RQ2RLSVI是否能在不依赖贝叶斯先验的前提下,实现关于问题参数的多项式最坏情况遗憾边界?
  • RQ3在频率学设定下,RLSVI的性能与乐观算法相比如何,尤其是在理论保证方面?
  • RQ4能否将线性Bandits中Thompson采样分析的思路,通过这种随机化值函数方法推广到表格型强化学习?
  • RQ5噪声方差在确保乐观性以及控制RLSVI框架中遗憾方面起什么作用?

主要发现

  • 该论文为表格型有限horizon MDP中的RLSVI建立了最坏情况下的遗憾边界,表明遗憾随问题参数呈多项式增长。
  • 遗憾边界为 $\tilde{O}(H^3 \sqrt{SK})$,其中 $H$ 为horizon,$S$ 为状态数,$A$ 为动作数,$K$ 为episode数。
  • 分析表明,RLSVI采样的每个随机化值函数都有恒定概率是乐观的,这是遗憾推导中的关键步骤。
  • 通过在奖励和转移估计误差上的集中不等式,对扰动MDP与真实MDP之间值函数的期望差异进行了有界处理。
  • 值函数范数 $\|V^{k}_{h+1}\|_\infty$ 的界被证明为 $\tilde{O}(H^{5/2}\sqrt{S})$,这有助于整体遗憾的缩放。
  • 该方法在无需显式不确定性集或后验抽样的情况下实现了鲁棒性能,使其与标准函数逼近方法兼容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。