Skip to main content
QUICK REVIEW

[论文解读] A Multi-Armed Bandit Approach for Online Expert Selection in Markov Decision Processes

Eric Mazumdar, Roy Dong|arXiv (Cornell University)|Jul 18, 2017
Advanced Bandit Algorithms Research参考文献 17被引用 9
一句话总结

本文提出了一种多臂赌博机(MAB)框架,用于马尔可夫决策过程(MDPs)中的在线专家选择,其中多个预训练的专家策略被动态选择以最大化累积奖励。通过将上置信度界(UCB)算法适配到具有延迟状态混合的MDPs,该方法实现了对数 regret 增长,证明了在遍历性假设下的理论性能保证,并在 GridWorld 环境中进行了验证。

ABSTRACT

We formulate a multi-armed bandit (MAB) approach to choosing expert policies online in Markov decision processes (MDPs). Given a set of expert policies trained on a state and action space, the goal is to maximize the cumulative reward of our agent. The hope is to quickly find the best expert in our set. The MAB formulation allows us to quantify the performance of an algorithm in terms of the regret incurred from not choosing the best expert from the beginning. We first develop the theoretical framework for MABs in MDPs, and then present a basic regret decomposition identity. We then adapt the classical Upper Confidence Bounds algorithm to the problem of choosing experts in MDPs and prove that the expected regret grows at worst at a logarithmic rate. Lastly, we validate the theory on a small MDP.

研究动机与目标

  • 开发一种在运行条件未知或变化时,用于 MDP 中在线选择专家策略的框架。
  • 解决在状态转移和奖励在时间步之间相互耦合的 MDP 中,动态切换专家的挑战。
  • 通过定义为与最佳专家稳态奖励的差值,量化性能,即 regret。
  • 通过考虑专家策略诱导的马尔可夫链的瞬态效应和混合速率,将经典 MAB 理论扩展到 MDP。
  • 通过在 GridWorld MDP 上的实证结果验证理论框架,显示对数 regret 和对环境变化的快速适应。

提出的方法

  • 将 MDP 中的专家选择形式化为多臂赌博机问题,其中每个专家是一个具有不同奖励分布的策略。
  • 引入基于时间 horizon 的切换策略:每个专家在使用 $ T_n $ 个时间步后切换,以确保瞬态效应衰减。
  • 推导出一个 regret 分解恒等式,其中包含一个与每个专家的马尔可夫链混合速率 $ \alpha_e $ 成比例的项,以捕捉瞬态误差。
  • 通过结合采样频率和混合时间的置信区间,将上置信度界(UCB)算法适配到 MDP 设置中。
  • 利用遍历性假设,将时间 horizon 内的期望奖励与专家的稳态奖励之间的偏差进行有界。
  • 采用随机核表示法来描述转移和奖励动态,从而实现对专家策略下状态分布演化的正式分析。

实验结果

研究问题

  • RQ1能否有效将多臂赌博机框架适配到具有耦合状态和奖励动态的 MDP 中的在线专家选择?
  • RQ2在 MDP 设置中,如何对切换专家所引起的瞬态效应进行理论有界?
  • RQ3在线专家选择算法在 MDP 中的 regret 增长率是多少,能否证明其呈对数增长?
  • RQ4专家诱导的马尔可夫链的混合速率如何影响实际奖励与稳态奖励之间的性能差距?
  • RQ5UCB 算法能否被修改以在具有延迟状态收敛的 MDP 中保持对数 regret?

主要发现

  • 在遍历性和混合速率假设下,所提出的基于 MAB 的专家选择算法的期望 regret 随时间最多呈对数增长,即 $ O(\log n) $。
  • 推导出一个 regret 分解恒等式,表明总 regret 受次优专家选择之和以及一个与每个专家的马尔可夫链混合速率 $ \alpha_e $ 成比例的加法误差项的有界。
  • 加法误差项的上界为 $ \frac{C_e(1 - \alpha_e^{T_n})}{T_n(1 - \alpha_e)} $,随着时间 horizon $ T_n $ 增加而衰减。
  • 在 GridWorld MDP 上的实证验证表明,基于 UCB 的算法实现了对数增长的 regret,并能快速适应环境变化。
  • 即使在测试动态未在训练数据中显式表示的情况下,该方法在未见或变化的条件下也表现出鲁棒性。
  • 理论 regret 上界较为保守,提示未来工作可能获得更紧致的边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。