Skip to main content
QUICK REVIEW

[论文解读] Non-Asymptotic Sequential Tests for Overlapping Hypotheses and application to near optimal arm identification in bandit models

Aurélien Garivier, Emilie Kaufmann|arXiv (Cornell University)|May 9, 2019
Advanced Bandit Algorithms Research参考文献 22被引用 9
一句话总结

本文针对重叠假设下的非渐近序贯检验,提出一种并行广义似然比检验(GLRT),并将其应用于多臂赌博机中的PAC最优臂识别问题。研究建立了样本复杂度的紧致非渐近界,并基于信息论论证推导出下界,表明所提策略在(ϵ,δ)-PAC准则下对正规赌博机实例具有最优性能。

ABSTRACT

In this paper, we study sequential testing problems with \emph{overlapping} hypotheses. We first focus on the simple problem of assessing if the mean $\mu$ of a Gaussian distribution is smaller or larger than a fixed $\epsilon>0$; if $\mu\in(-\epsilon,\epsilon)$, both answers are considered to be correct. Then, we consider PAC-best arm identification in a bandit model: given $K$ probability distributions on $\mathbb{R}$ with means $\mu_1,\dots,\mu_K$, we derive the asymptotic complexity of identifying, with risk at most $\delta$, an index $I\in\{1,\dots,K\}$ such that $\mu_I\geq \max_i\mu_i -\epsilon$. We provide non-asymptotic bounds on the error of a parallel General Likelihood Ratio Test, which can also be used for more general testing problems. We further propose lower bound on the number of observation needed to identify a correct hypothesis. Those lower bounds rely on information-theoretic arguments, and specifically on two versions of a change of measure lemma (a high-level form, and a low-level form) whose relative merits are discussed.

研究动机与目标

  • 为解决在主动学习设置下,重叠假设序贯检验缺乏非渐近分析的问题。
  • 将δ-正确最优臂识别推广至更实际的(ϵ,δ)-PAC框架,其中可能存在多个近似最优的臂。
  • 利用信息论工具,特别是测度变换引理,推导样本复杂度的非渐近下界。
  • 设计并分析一种结合并行GLRT与追踪采样规则的(ϵ,δ)-PAC策略,使其在正规赌博机模型下与下界匹配。

提出的方法

  • 提出一种并行广义似然比检验(GLRT),用于在多个假设可能同时成立的重叠假设下进行序贯检验。
  • 采用测度变换方法,通过高阶和低阶两种形式,推导GLRT的非渐近误差界。
  • 引入一种追踪采样规则,自适应地将采样分配给各臂,以收敛至最小化样本复杂度的最优分配。
  • 通过特征时间的凸优化公式,推导出期望停止时间的非渐近下界。
  • 将GLRT应用于具有高斯分布或指数族分布的多臂赌博机模型,确保在(ϵ,δ)-PAC准则下的δ-正确性。
  • 通过涉及Kullback-Leibler散度的极小化-极大化优化问题求解最优采样权重,在特定条件下获得闭式解。

实验结果

研究问题

  • RQ1当多个假设可能成立时,能否为重叠假设下的序贯检验推导出非渐近界?
  • RQ2在高概率(1−δ)下识别一个ϵ-最优臂,所需的最小样本复杂度是多少?
  • RQ3在(ϵ,δ)-PAC设置下,所提并行GLRT的性能与信息论下界相比如何?
  • RQ4能否设计一种追踪采样规则,使正规赌博机实例的样本复杂度下界得以实现?
  • RQ5在(ϵ,δ)-PAC设置下,最优采样权重的结构是什么?如何高效计算?

主要发现

  • 并行GLRT在多臂赌博机中实现了(ϵ,δ)-PAC最优臂识别的δ-正确性,其非渐近误差界随ln(1/δ)增长。
  • 基于信息论论证,推导出期望停止时间的非渐近下界,表明特征时间是凸优化问题的解。
  • 对于正规赌博机实例,所提(ϵ,δ)-PAC策略结合追踪采样规则与推导的下界完全匹配,证明了渐近最优性。
  • 最优采样权重作为涉及KL散度的极小化-极大化优化问题的解,其唯一解由包含KL逆导数的方程组刻画。
  • 在特殊情形下,若某臂均值为µ+ −ϵ,另一臂均值为µ+,则最优权重将全部分配给最优臂,使解简化。
  • 分析表明,在重叠假设设置下,高阶信息论推理失效,必须依赖低阶测度变换论证以获得紧致界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。