[论文解读] Regime Switching Bandits
本文提出了一种针对奖励呈现状态切换的多臂赌博机问题的新型学习算法,其中奖励受一个未观测到的马尔可夫状态调制。该算法结合了隐马尔可夫模型的谱估计方法与上置信度界(UCB)方法,实现了 $O(T^{2/3} ho heta ext{sqrt}{\log T})$ 的遗憾界,显著优于依赖较弱预言机的先前方法。
We study a multi-armed bandit problem where the rewards exhibit regime switching. Specifically, the distributions of the random rewards generated from all arms are modulated by a common underlying state modeled as a finite-state Markov chain. The agent does not observe the underlying state and has to learn the transition matrix and the reward distributions. We propose a learning algorithm for this problem, building on spectral method-of-moments estimations for hidden Markov models, belief error control in partially observable Markov decision processes and upper-confidence-bound methods for online learning. We also establish an upper bound $O(T^{2/3}\sqrt{\log T})$ for the proposed learning algorithm where $T$ is the learning horizon. Finally, we conduct proof-of-concept experiments to illustrate the performance of the learning algorithm.
研究动机与目标
- 解决奖励分布在隐藏状态之间切换的多臂赌博机问题,其中隐藏状态由有限状态的马尔可夫链建模。
- 设计一种无需观测底层状态的学习算法,同时学习转移矩阵和奖励分布。
- 在已知真实模型参数但未知隐藏状态的强预言机基准下,建立次线性遗憾界。
- 在理论性能上超越先前依赖较弱预言机(如最优固定臂或无记忆策略)的方法。
提出的方法
- 该算法使用谱矩方法估计器,从未观测到的奖励中估计转移矩阵 $P$ 和奖励分布 $Q(\cdot|m,i)$。
- 将学习时域划分为嵌套的探索与利用阶段,以平衡学习与决策。
- 在每个探索阶段,使用谱估计器基于有限样本保证估计模型参数。
- 在每个利用阶段,应用UCB方法控制遗憾,利用基于更新后信念状态的乐观值函数。
- 在每个利用阶段开始时,使用前一探索阶段获得的最新参数估计值重新校准信念状态。
- 通过随时间限制估计误差的影响,控制信念误差的传播,利用 Azuma-Hoeffding 不等式实现鞅集中性。
实验结果
研究问题
- RQ1在未观测到马尔可夫状态的多臂赌博机设置中,学习算法能否实现次线性遗憾?
- RQ2如何有效结合谱估计与UCB方法,以处理部分可观测的马尔可夫决策过程?
- RQ3在该状态切换赌博机模型中,在线学习可达到的最紧致遗憾界是什么?
- RQ4所提出的算法性能与知识有限的预言机(如最优固定臂)相比如何?
主要发现
- 所提出的算法在高概率下实现了 $O(T^{2/3}\sqrt{\log T})$ 的遗憾界,其中 $T$ 为学习时域。
- 该遗憾界在强预言机基准下建立,该预言机知道真实模型参数但未知隐藏状态。
- 分析考虑了由于未观测到的隐藏状态以及 $P$ 和 $Q(\cdot|m,i)$ 的估计误差所导致的信念状态误差传播。
- 谱矩方法提供了有限样本估计保证,克服了隐马尔可夫模型中最大似然估计器有限样本界这一开放问题。
- 通过概念验证实验验证了算法性能,证明了信念重校准与嵌套阶段设计的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。