Skip to main content
QUICK REVIEW

[论文解读] Optimal Best Markovian Arm Identification with Fixed Confidence

Vrettos Moulos|arXiv (Cornell University)|Dec 2, 2019
Advanced Bandit Algorithms Research被引用 12
一句话总结

本文首次为具有固定置信度的一参数马尔可夫伯努利 bandit 模型中的最优臂识别问题建立了实例相关的非渐近下界。本文分析了在马尔可夫依赖下的追踪-停止策略,并证明其样本复杂度在渐近意义上与推导出的下界相差不超过四倍,同时提出了一种新的马尔可夫链浓度不等式,实现了最优的指数衰减且前导因子为常数。

ABSTRACT

We give a complete characterization of the sampling complexity of best Markovian arm identification in one-parameter Markovian bandit models. We derive instance specific nonasymptotic and asymptotic lower bounds which generalize those of the IID setting. We analyze the Track-and-Stop strategy, initially proposed for the IID setting, and we prove that asymptotically it is at most a factor of four apart from the lower bound. Our one-parameter Markovian bandit model is based on the notion of an exponential family of stochastic matrices for which we establish many useful properties. For the analysis of the Track-and-Stop strategy we derive a novel concentration inequality for Markov chains that may be of interest in its own right.

研究动机与目标

  • 刻画一参数马尔可夫伯努利 bandit 模型中具有固定置信度的最优臂识别的采样复杂度。
  • 将独立同分布(IID)设定下的实例相关下界推广至更复杂的马尔可夫依赖设定。
  • 分析追踪-停止策略在马尔可夫过程下的渐近性能。
  • 建立一种针对马尔可夫链经验均值的新浓度不等式,实现最优指数衰减与常数前导因子。
  • 将随机多臂 bandit 的理论基础扩展至包含马尔可夫依赖臂,以支持更丰富的建模。

提出的方法

  • 基于指数族的随机矩阵构建一参数马尔可夫伯努利 bandit 模型,以捕捉臂奖励中的马尔可夫依赖。
  • 利用马尔可夫链的大偏差理论,推导出期望样本复杂度的实例相关非渐近与渐近下界。
  • 将原本为 IID 情况设计的追踪-停止策略适配至马尔可夫设定,并证明其渐近最优性与下界相差不超过四倍。
  • 提出一种针对马尔可夫链经验均值的新浓度不等式,实现最优指数衰减且前导因子为常数,避免了先前工作中存在的多项式因子。
  • 采用广义 Jensen-Shannon 散度的变分表征,将 Chernoff 停止规则与采样策略及错误概率联系起来。
  • 结合马尔可夫链的大数定律与新浓度不等式,分析追踪-停止策略的渐近行为。

实验结果

研究问题

  • RQ1在一参数马尔可夫伯努利 bandit 模型中,具有固定置信度的最优臂识别的实例相关采样复杂度下界是什么?
  • RQ2相较于 IID 情况,追踪-停止策略在马尔可夫依赖下的性能退化程度如何?
  • RQ3能否推导出一种针对马尔可夫链经验均值的浓度不等式,使其具有最优指数衰减与常数前导因子?
  • RQ4最优臂识别的理论框架在多大程度上可从 IID 推广至马尔可夫依赖过程?
  • RQ5在马尔可夫设定下,追踪-停止策略的样本复杂度与信息论下界之间的渐近差距是多少?

主要发现

  • 本文建立了最优马尔可夫臂识别的非渐近、实例相关的期望样本复杂度下界,推广了 IID 情况下的结果。
  • 证明了在马尔可夫设定下,追踪-停止策略的渐近样本复杂度与推导出的下界相差不超过四倍。
  • 证明了一种针对马尔可夫链经验均值的新浓度不等式,实现了最优指数衰减与常数前导因子,优于先前工作中的多项式前导因子。
  • 正式刻画了随机矩阵的指数族,并用于建模一参数马尔可夫伯努利 bandit 模型,从而支持对采样复杂度的严格分析。
  • 分析结果确认,$(\alpha,\delta)$-追踪-停止策略在马尔可夫模型下是 $\delta$-PAC(可能近似正确)的,且具有有限的期望样本复杂度。
  • 研究结果将随机多臂 bandit 的理论基础扩展至包含马尔可夫依赖臂,支持在自适应路由、临床试验等应用中实现更丰富的建模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。