[论文解读] Regret Bounds for Thompson Sampling in Episodic Restless Bandit Problems
本文研究了在系统参数未知的周期性非齐次多臂赌博机问题中,Thompson采样方法的性能,证明了在一般策略映射竞争者下的贝叶斯遗憾界为$\tilde{\mathcal{O}}(\sqrt{T})$。该方法允许灵活地与最优策略、Whittle索引策略或短视策略等进行比较,模拟结果在Gilbert-Elliott信道模型中验证了理论发现。
Restless bandit problems are instances of non-stationary multi-armed bandits. These problems have been studied well from the optimization perspective, where the goal is to efficiently find a near-optimal policy when system parameters are known. However, very few papers adopt a learning perspective, where the parameters are unknown. In this paper, we analyze the performance of Thompson sampling in episodic restless bandits with unknown parameters. We consider a general policy map to define our competitor and prove an $ ilde{\mathcal{O}}(\sqrt{T})$ Bayesian regret bound. Our competitor is flexible enough to represent various benchmarks including the best fixed action policy, the optimal policy, the Whittle index policy, or the myopic policy. We also present empirical results that support our theoretical findings.
研究动机与目标
- 研究系统参数未知的周期性非齐次多臂赌博机问题中Thompson采样的性能。
- 建立适用于广泛竞争者策略类别的贝叶斯遗憾界,包括最优策略、Whittle索引策略和短视策略。
- 通过利用周期性重置和贝叶斯推断,解决非齐次多臂赌博机中的部分可观察性问题。
- 证明即使基准策略较弱或次优,Thompson采样仍能实现次线性遗憾。
- 在离散先验条件下,将理论结果扩展至频率学派框架,并通过实证方法验证性能。
提出的方法
- 将问题建模为部分可观察的马尔可夫决策过程(POMDP),具有二值奖励和依赖于动作选择的马尔可夫状态转移。
- 假设采用周期性结构,每$L$个时间步进行一次系统重置,从而将分析简化为有限horizon问题。
- 引入一般策略映射以定义竞争者,使基准策略可为任意确定性策略,包括最优策略、Whittle索引策略或短视策略。
- 通过维护对未知系统参数(转移矩阵和初始状态)的后验分布,并从该后验中采样动作,来应用Thompson采样。
- 遗憾定义为相对于真实参数下竞争者策略价值的差距,利用集中不等式和后验收缩性来界定贝叶斯遗憾。
- 通过已知参数的模拟Gilbert-Elliott信道进行实证验证,跟踪价值函数收敛性和后验权重动态变化。
实验结果
研究问题
- RQ1在系统参数未知的周期性非齐次多臂赌博机问题中,Thompson采样能否实现次线性遗憾界?
- RQ2当竞争者策略并非最优策略(如Whittle索引或短视策略)时,$\tilde{\mathcal{O}}(\sqrt{T})$的遗憾界是否依然成立?
- RQ3当基准策略较弱或次优时,Thompson采样在实际中表现如何?
- RQ4贝叶斯遗憾界能否在离散先验下扩展至频率学派遗憾?
- RQ5在不同竞争者映射下,Thompson采样中对真实参数的后验权重如何随时间演变?
主要发现
- 本文为周期性非齐次多臂赌博机中的Thompson采样建立了$\tilde{\mathcal{O}}(\sqrt{T})$的贝叶斯遗憾界,适用于任意确定性策略映射作为竞争者。
- 实证结果表明,贝叶斯遗憾呈次线性增长,其$\log$-$\log$斜率小于$1/2$,支持理论边界。
- 在$K=4$,$N=2$且转移概率对称的模拟中,Thompson采样的价值函数收敛至Whittle索引策略的基准值,即每周期55.6。
- 对真实参数的后验权重随周期单调增加,证实了有效学习和参数集中。
- 即使基准为最佳固定臂策略(在一般非齐次多臂赌博机设置中已知为次优),遗憾仍保持次线性。
- 当先验具有离散支撑且基准为最优策略时,理论结果可扩展至频率学派遗憾,且实证结果提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。