Skip to main content
QUICK REVIEW

[论文解读] Inference for Batched Bandits

Kelly Zhang, Lucas Janson|PubMed|Feb 8, 2020
Advanced Bandit Algorithms Research参考文献 44被引用 19
一句话总结

本文提出了批次普通最小二乘法(BOLS)估计器,以实现对通过批次老虎机算法收集的数据的有效统计推断,其中由于自适应、依赖性采样,标准OLS失效。本文证明,当各臂之间的差距为零时,OLS在渐近意义上非正态分布,导致推断无效;BOLS恢复了渐近正态性,并对非平稳性具有鲁棒性,从而能够为处理效应差异构建可靠的置信区间。

ABSTRACT

As bandit algorithms are increasingly utilized in scientific studies and industrial applications, there is an associated increasing need for reliable inference methods based on the resulting adaptively-collected data. In this work, we develop methods for inference on data collected in batches using a bandit algorithm. We first prove that the ordinary least squares estimator (OLS), which is asymptotically normal on independently sampled data, is <i>not</i> asymptotically normal on data collected using standard bandit algorithms when there is no unique optimal arm. This asymptotic non-normality result implies that the naive assumption that the OLS estimator is approximately normal can lead to Type-1 error inflation and confidence intervals with below-nominal coverage probabilities. Second, we introduce the Batched OLS estimator (BOLS) that we prove is (1) asymptotically normal on data collected from both multi-arm and contextual bandits and (2) robust to non-stationarity in the baseline reward.

研究动机与目标

  • 为解决使用老虎机算法收集数据时缺乏可靠的统计推断方法的问题,特别是在在线教育和移动健康等实际应用中。
  • 识别并解决一个根本性问题:当真实各臂之间的差距为零时,普通最小二乘法(OLS)估计器在渐近意义上非正态分布,从而破坏标准推断的有效性。
  • 开发一种新估计器——批次OLS(BOLS),确保在多臂和上下文老虎机设置下,即使奖励非平稳,也能保持渐近正态性。
  • 确保在时间非平稳性条件下推断依然有效,即各臂均值随时间变化,而无需假设平稳性。
  • 提供一种实用的、渐近有效的置信区间构建方法,用于老虎机收集的数据,以支持科学发现和可推广的结论。

提出的方法

  • 提出批次OLS(BOLS)估计器作为OLS的改进版本,通过校正自适应老虎机采样引起的依赖性。
  • 引入W去相关估计器框架,通过使用时间衰减加权矩阵重新加权OLS残差,以打破设计矩阵与误差项之间的相关性。
  • 通过递归更新规则推导最优加权矩阵W:$\textbf{W}_{i} = (\underline{\textbf{I}}_{p} - \underline{\textbf{W}}_{i-1}\underline{\textbf{X}}_{i-1}) \frac{\textbf{X}_{i}}{\lambda + \|\textbf{X}_{i}\|^{2}_{2}}$,以确保去相关性。
  • 通过设置$\lambda \geq 1$实现时间折扣,降低后期样本的权重,提高早期样本的权重,从而在非平稳性条件下稳定估计器。
  • 证明BOLS在多臂和上下文老虎机设置下均具有渐近正态性,即使在差距为零或奖励非平稳的情况下也成立。
  • 在双臂老虎机情况下,证明W去相关估计器通过$ r(1-r)^{N_{1,i-1}} $显式降低后期观测的权重,其中$ r = 1/(\lambda+1) $。

实验结果

研究问题

  • RQ1当两个老虎机臂之间的差距为零时,为何普通最小二乘法(OLS)估计器无法保持渐近正态性?
  • RQ2能否构建一种改进的OLS估计器,使其在自适应、批次老虎机采样下仍保持渐近正态性,即使最优臂不唯一?
  • RQ3如何使统计推断对老虎机实验中各批次奖励的非平稳性具有鲁棒性?
  • RQ4为何在BOLS估计器中使用时间衰减加权方案具有理论依据,以校正采样依赖性?
  • RQ5当真实差距为零时,BOLS估计器是否仍能保持对处理效应置信区间的有效覆盖?

主要发现

  • 当真实各臂之间的差距为零时,由于老虎机算法中各臂选择概率不集中,OLS估计器在渐近意义上非正态分布。
  • 当差距非零时,OLS是渐近正态的,但缺乏一致收敛性,导致标准推断方法(如正态近似和自助法)失效。
  • 批次OLS(BOLS)估计器在多臂和上下文老虎机设置下均被证明具有渐近正态性,即使最优臂不唯一。
  • BOLS在非平稳奖励过程中依然有效,即各臂均值随时间变化,且无需假设平稳性。
  • W去相关估计器通过应用时间衰减权重实现去相关性,第i个样本的权重与$ r(1-r)^{N_{1,i-1}} $成正比,其中$ r = 1/(\lambda+1) $。
  • BOLS估计器能够为处理效应差异构建可靠的置信区间,其覆盖概率接近名义水平,即使在非i.i.d.和非平稳设置下也成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。