Skip to main content
QUICK REVIEW

[论文解读] Nearly Minimax Optimal Regret for Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation

Yue Wu, Dongruo Zhou|arXiv (Cornell University)|Feb 15, 2021
Reinforcement Learning in Robotics参考文献 31被引用 4
一句话总结

该论文提出UCRL2-VTR,一种基于模型的强化学习算法,用于具有线性函数近似的无限时域平均奖励MDP。通过将UCRL2扩展为使用价值目标回归和伯恩斯坦类型奖励,该算法实现了几乎最小最大最优的遗憾界$\widetilde{O}(d\sqrt{DT})$,与推导出的下界$\widetilde{\Omega}(d\sqrt{DT})$在对数因子范围内匹配,使其成为该设置下首个几乎最优的算法。

ABSTRACT

We study reinforcement learning in an infinite-horizon average-reward setting with linear function approximation, where the transition probability function of the underlying Markov Decision Process (MDP) admits a linear form over a feature mapping of the current state, action, and next state. We propose a new algorithm UCRL2-VTR, which can be seen as an extension of the UCRL2 algorithm with linear function approximation. We show that UCRL2-VTR with Bernstein-type bonus can achieve a regret of $ ilde{O}(d\sqrt{DT})$, where $d$ is the dimension of the feature mapping, $T$ is the horizon, and $\sqrt{D}$ is the diameter of the MDP. We also prove a matching lower bound $ ildeΩ(d\sqrt{DT})$, which suggests that the proposed UCRL2-VTR is minimax optimal up to logarithmic factors. To the best of our knowledge, our algorithm is the first nearly minimax optimal RL algorithm with function approximation in the infinite-horizon average-reward setting.

研究动机与目标

  • 为具有线性函数近似的无限时域平均奖励MDP中的强化学习填补遗憾最优性方面的差距。
  • 开发一种可证明高效的算法,利用大规模状态空间和动作空间中的线性结构。
  • 在平均奖励设置下,为线性混合MDP建立上界和匹配的下界遗憾。
  • 将面对不确定性的乐观性原则(OFU)扩展至具有函数近似的平均奖励设置。

提出的方法

  • 提出UCRL2-VTR,UCRL2的扩展版本,使用价值目标回归通过偏差函数期望的最小二乘法估计转移动态。
  • 采用伯恩斯坦类型奖励进行探索,相比霍夫丁类型奖励,改善了遗憾的缩放性能。
  • 使用线性混合MDP,其中转移概率在状态、动作和下一状态的特征映射上线性相关。
  • 应用一种专为平均奖励设置设计的新遗憾分解,与回合制或折扣MDP有本质区别。
  • 引入一种价值目标回归的变体,通过偏差函数的经验期望估计未知的转移核。
  • 推导出下界$\widetilde{\Omega}(d\sqrt{DT})$,以在对数因子范围内确认最小最大最优性。

实验结果

研究问题

  • RQ1基于模型的强化学习算法是否能在具有线性函数近似的无限时域平均奖励MDP中实现几乎最小最大最优的遗憾?
  • RQ2UCRL2-VTR的遗憾如何随特征维数$d$、时间范围$T$和MDP直径$D$而变化?
  • RQ3所提出的遗憾界是否在对数因子范围内紧致,能否建立匹配的下界?
  • RQ4面对不确定性的乐观性原则能否有效适应具有函数近似的平均奖励设置?

主要发现

  • UCRL2-VTR结合伯恩斯坦类型奖励,在线性混合MDP中实现了$\widetilde{O}(d\sqrt{DT})$的遗憾界。
  • 该算法与推导出的下界$\widetilde{\Omega}(d\sqrt{DT})$相匹配,确认了在对数因子范围内的几乎最小最大最优性。
  • 在实验中,UCRL2-VTR通过利用底层线性结构,优于表格型基于模型的基线方法(如UCRL、SCAL)。
  • 采用霍夫丁类型奖励的UCRL2-VTR版本实现了$\widetilde{O}(dD\sqrt{T})$的遗憾,相比伯恩斯坦变体表现次优。
  • 本工作首次为无限时域平均奖励MDP设置下的函数近似建立了几乎最小最大最优的遗憾界。
  • 遗憾分析需要一种专为平均奖励设置设计的新分解方式,与回合制或折扣MDP分析有根本性不同。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。