Skip to main content
QUICK REVIEW

[论文解读] Online Learning for Unknown Partially Observable MDPs

Mehdi Jafarnia-Jahromi, Rahul Jain|arXiv (Cornell University)|Feb 25, 2021
Reinforcement Learning in Robotics参考文献 48被引用 7
一句话总结

该论文提出PSRL-POMDP,一种基于后验抽样的强化学习算法,用于未知的完全可观察马尔可夫决策过程(POMDPs),其观测模型已知。对于有限参数集,该算法实现了$\mathcal{O}(\log T)$的贝叶斯期望遗憾;对于连续参数集,遗憾为$\tilde{\mathcal{O}}(T^{2/3})$,这是首个在POMDP上实现次线性遗憾的在线强化学习算法。

ABSTRACT

Solving Partially Observable Markov Decision Processes (POMDPs) is hard. Learning optimal controllers for POMDPs when the model is unknown is harder. Online learning of optimal controllers for unknown POMDPs, which requires efficient learning using regret-minimizing algorithms that effectively tradeoff exploration and exploitation, is even harder, and no solution exists currently. In this paper, we consider infinite-horizon average-cost POMDPs with unknown transition model, though a known observation model. We propose a natural posterior sampling-based reinforcement learning algorithm (PSRL-POMDP) and show that it achieves a regret bound of $O(\log T)$, where $T$ is the time horizon, when the parameter set is finite. In the general case (continuous parameter set), we show that the algorithm achieves $O (T^{2/3})$ regret under two technical assumptions. To the best of our knowledge, this is the first online RL algorithm for POMDPs and has sub-linear regret.

研究动机与目标

  • 解决在转移动态未知但观测模型已知的POMDP中进行在线强化学习的挑战。
  • 设计一种探索与利用平衡的算法,实现在平均成本无限时域设置下的次线性遗憾。
  • 将后验抽样方法从MDPs扩展到POMDPs,以处理未观测到的状态和信念状态动态。
  • 为在线学习中的POMDP建立理论遗憾边界,填补了文献中此前的空白。

提出的方法

  • 提出PSRL-POMDP,一种后验抽样算法,同时维护转移模型和潜在状态的后验分布。
  • 引入伪计数的概念,以在缺乏直接状态观测的情况下估计状态动作访问频率。
  • 基于已知的观测核和抽样得到的转移模型,使用信念状态更新来指导策略选择。
  • 采用长度递增的宏观回合,以在探索与利用之间取得平衡,同时控制遗憾。
  • 应用集中不等式和访问计数的递归边界,推导出遗憾保证。
  • 利用信念空间MDP的结构和后验抽样,即使在部分可观察的情况下,也能实现次线性遗憾。

实验结果

研究问题

  • RQ1基于后验抽样的算法是否能在未知POMDP的在线学习中实现次线性遗憾?
  • RQ2当状态无法直接观测且转移动态未知时,如何在POMDP中维持有效的探索?
  • RQ3在有限和连续参数集下,能否为POMDP中的在线强化学习建立理论遗憾边界?
  • RQ4如何定义并使用伪计数来近似POMDP中的真实状态动作访问计数?
  • RQ5MDPs的后验抽样理论框架能否扩展以处理POMDP中的信念状态动态?

主要发现

  • 当转移核参数集为有限时,PSRL-POMDP实现了$\mathcal{O}(\log T)$的贝叶斯期望遗憾。
  • 对于具有连续参数集的一般情况,该算法在两个技术假设下实现了$\tilde{\mathcal{O}}(T^{2/3})$的遗憾。
  • 该算法同时维护转移模型和隐藏状态的后验分布,从而实现有效的信念更新。
  • 引入了伪计数以估计状态动作访问频率,替代了在未观测状态下的直接计数。
  • 遗憾分析依赖于对每个回合中$T_k / \sqrt{t_k}$之和的有界性,其中$T_k$为回合长度,$t_k$为累计时间。
  • 该结果首次为POMDP建立了具有可证明次线性遗憾的在线强化学习算法,填补了文献中的关键空白。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。