[论文解读] Optimizing Adaptive Experiments: A Unified Approach to Regret Minimization and Best-Arm Identification
本文通过引入一种具有实验阶段与部署阶段不同成本的广义老虎机模型,统一了自适应实验中的后悔最小化与最优臂识别问题。研究表明,渐近最优策略仅依赖于探索的信息平衡与一个可调的利用速率,使得诸如top-two Thompson采样等算法可通过单一标量参数适配广泛的目标函数,即使在实验长度大幅缩短的情况下也能实现极低的后悔。
Practitioners conducting adaptive experiments often encounter two competing priorities: maximizing total welfare (or `reward') through effective treatment assignment and swiftly concluding experiments to implement population-wide treatments. Current literature addresses these priorities separately, with regret minimization studies focusing on the former and best-arm identification research on the latter. This paper bridges this divide by proposing a unified model that simultaneously accounts for within-experiment performance and post-experiment outcomes. We provide a sharp theory of optimal performance in large populations that not only unifies canonical results in the literature but also uncovers novel insights. Our theory reveals that familiar algorithms, such as the recently proposed top-two Thompson sampling algorithm, can optimize a broad class of objectives if a single scalar parameter is appropriately adjusted. In addition, we demonstrate that substantial reductions in experiment duration can often be achieved with minimal impact on both within-experiment and post-experiment regret.
研究动机与目标
- 弥合现有文献中将后悔最小化与最优臂识别视为独立问题的差距。
- 构建一个统一的理论框架,同时考虑实验期间的处理成本与实验后的部署结果。
- 刻画大规模群体中实验长度与总后悔之间的渐近权衡。
- 识别在异质周期成本下渐近高效策略的结构性质,且这些性质与每周期成本函数无关。
- 证明在几乎不影响累积后悔的前提下,可显著缩短实验时长。
提出的方法
- 提出一种广义多臂老虎机模型,通过独立的周期成本函数分别建模实验阶段与部署阶段的处理成本。
- 引入一种归一化性能度量,使总成本随群体规模对数缩放,类似于Lai和Robbins(1985)在后悔最小化中的设定。
- 识别出最优探索分配遵循信息平衡原则——对次优臂的证据必须以相等速率增长,该原则与成本函数无关。
- 表明成本感知优化可简化为调节单一利用速率参数,而探索分布则完全由统计平衡决定。
- 通过双人零和博弈形式重新表达最优臂识别的复杂度常数,其形式与Lai和Robbins(1985)类似。
- 将理论应用于刻画实验长度与总后悔之间的帕累托前沿,推导出精确的渐近权衡关系。
实验结果
研究问题
- RQ1如何在单一自适应实验框架中正式统一后悔最小化与最优臂识别?
- RQ2在存在异质周期成本的情况下,渐近高效策略的结构性质是什么?
- RQ3在不显著增加总后悔的前提下,实验时长可被缩短到何种程度?
- RQ4现有老虎机算法能否在最小修改下适配优化广泛目标函数?
- RQ5在大规模群体中,实验长度与总后悔之间的精确渐近权衡是什么?
主要发现
- 最优臂识别的复杂度常数被重表述为双人零和博弈的值,通过变量替换后与Lai和Robbins(1985)的形式一致。
- 渐近高效策略几乎与成本函数无关;探索力度应分配以平衡对次优臂的统计证据。
- top-two Thompson采样算法在高斯老虎机中是渐近高效的,因为它满足信息平衡条件。
- 实验时长可显著缩短而对总后悔影响极小——在某些情形下,实验可缩短至原长的50%,总后悔增加不足5%。
- 实验长度与总后悔之间的帕累托前沿被精确刻画,最小化归一化长度与后悔的策略由参数 β ∈ (β_BAI, 1) 参数化。
- 对于高斯老虎机,归一化后悔满足 R_θ^(β) ≤ (1/β) R_θ^(1),表明当 β 接近 1 时,后悔随 1/β 线性增长。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。