Skip to main content
QUICK REVIEW

[论文解读] Contextual Markov Decision Processes using Generalized Linear Models

Aditya Modi, Ambuj Tewari|arXiv (Cornell University)|Apr 28, 2019
Advanced Bandit Algorithms Research参考文献 11被引用 8
一句话总结

本文提出 GL-ORL,一种针对上下文马尔可夫决策过程(CMDPs)的无遗憾在线强化学习算法,其中参数通过广义线性模型(GLMs)建模。该算法使用高效的在线牛顿步更新构建置信集,并在 logit 链接情况下建立了改进的遗憾界,同时在具有上下文依赖性的环境中实现了记忆高效的 episodic 交互学习。

ABSTRACT

We consider the recently proposed reinforcement learning (RL) framework of Contextual Markov Decision Processes (CMDP), where the agent has a sequence of episodic interactions with tabular environments chosen from a possibly infinite set. The parameters of these environments depend on a context vector that is available to the agent at the start of each episode. In this paper, we propose a no-regret online RL algorithm in the setting where the MDP parameters are obtained from the context using generalized linear models (GLMs). The proposed algorithm exttt{GL-ORL} relies on efficient online updates and is also memory efficient. Our analysis of the algorithm gives new results in the logit link case and improves previous bounds in the linear case. Our algorithm uses efficient Online Newton Step updates to build confidence sets. Moreover, for any strongly convex link function, we also show a generic conversion from any online no-regret algorithm to confidence sets.

研究动机与目标

  • 开发一种适用于环境参数依赖于上下文向量的上下文 MDP 的无遗憾在线 RL 算法。
  • 使用广义线性模型(GLMs)对 MDP 参数进行建模,以实现对上下文依赖环境的可扩展且结构化的表示。
  • 在具有潜在无限 MDP 的 episodic 学习设置中,确保内存效率和快速在线更新。
  • 为 logit 链接函数推导更紧的遗憾界,并在线性情况下改进先前结果。
  • 提供一种通用方法,将任意在线无遗憾算法转换为基于 GLM 的 CMDPs 的置信集构建机制。

提出的方法

  • 该算法 GL-ORL 使用在线牛顿步更新,在线维护并更新模型参数的置信集。
  • 将 MDP 的转移和奖励函数建模为由上下文向量参数化的广义线性模型(GLMs)。
  • 通过利用链接函数的曲率,基于对数似然的 Hessian 矩阵构建置信集,以获得更紧的不确定性估计。
  • 对于任意强凸链接函数,该框架可将任意在线无遗憾算法通用地转换为置信集构建机制。
  • 通过基于置信集的上置信度边界,该算法通过平衡探索与利用来确保无遗憾学习。
  • 通过避免存储完整历史记录,仅依赖充分统计量的递归更新,实现低内存使用。

实验结果

研究问题

  • RQ1能否为 GLM 参数化环境的 CMDPs 设计一种无遗憾在线 RL 算法?
  • RQ2在该设置下,如何实现高效且内存高效的在线更新?
  • RQ3与先前工作相比,logit 链接函数在遗憾界方面能实现哪些改进?
  • RQ4能否为基于 GLM 的 CMDPs 建立从在线无遗憾算法到置信集构建的通用转换机制?
  • RQ5使用在线牛顿步更新如何提升置信集质量与遗憾性能?

主要发现

  • GL-ORL 算法在 GLM 参数化 MDP 的 CMDP 框架下实现了无遗憾保证,确保随时间推移的次线性遗憾。
  • 对于 logit 链接函数,本文建立了新的遗憾界,优于文献中已知的先前结果。
  • 在线性情况下,GL-ORL 实现的遗憾界优于早期工作,展现出更紧的性能保证。
  • 使用在线牛顿步更新可实现高效且精确的置信集构建,这对探索与利用的权衡至关重要。
  • 已证明一种通用转换机制,可将任意在线无遗憾算法转换为基于 GLM 的 CMDPs 的置信集构建方法,适用于强凸链接函数。
  • 该算法通过依赖递归更新而非存储完整数据历史,保持了内存效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。