Skip to main content
QUICK REVIEW

[论文解读] Asymptotic Representations for Sequential Decisions, Adaptive Experiments, and Batched Bandits

Keisuke Hirano, Jack R. Porter|arXiv (Cornell University)|Feb 6, 2023
Advanced Statistical Process MonitoringDecision Sciences被引用 3
一句话总结

该论文为涉及自适应实验和分批Bandit的序列决策问题发展了渐近表示理论,表明在局部替代假设下,所有极限分布均可由一个单一的极限高斯Bandit模型表征。该框架使在处理分配影响后续数据收集的自适应环境中实现有效推断、最优设计搜索和统计功效分析成为可能。

ABSTRACT

We develop asymptotic approximations that can be applied to sequential estimation and inference problems, adaptive randomized controlled trials, and related settings. In batched adaptive settings where the decision at one stage can affect the observation of variables in later stages, our asymptotic representation characterizes all limit distributions attainable through a joint choice of an adaptive design rule and statistics applied to the adaptively generated data. This facilitates local power analysis of tests, comparison of adaptive treatments rules, and other analyses of batchwise sequential statistical decision rules.

研究动机与目标

  • 解决在具有结构化、内生信息集的序列和自适应统计决策问题中缺乏通用渐近近似工具的问题。
  • 将经典渐近表示定理扩展至处理分配与数据收集均自适应选择的动态多阶段设置。
  • 为分析自适应随机对照试验和分批Bandit问题中统计程序的渐近行为,提供统一框架。
  • 在局部渐近理论下,支持自适应采样规则和推断程序的比较。
  • 通过表征极限数据环境(极限Bandit)中的可达极限分布,支持最优自适应实验的设计。

提出的方法

  • 构建一个称为“极限Bandit”的极限数据环境,以捕捉序列信息约束以及自适应设计规则与数据生成之间的相互作用。
  • 采用Hirano和Porter(2009)的精神,使用局部参数化方法建模局部替代假设,其中处理效应较小但可估计。
  • 构建渐近表示,将原始序列决策问题与一个简化的极限高斯Bandit模型联系起来。
  • 将该表示应用于分析如ZJM检验和Thompson采样下池化均值差检验的局部渐近功效。
  • 通过数值评估(模拟或积分)比较相同极限模型下不同推断程序的效能曲线。
  • 引入一种向平衡分配收缩的加权Thompson采样规则,以评估分配效率与推断效率之间的权衡。

实验结果

研究问题

  • RQ1如何将渐近近似推广至具有自适应采样和处理分配的序列决策问题?
  • RQ2在处理分配依赖于历史数据的自适应实验中,检验统计量的极限分布是什么?
  • RQ3如ZJM检验等推断程序的效能与自适应分批设计中的最优效能包络相比如何?
  • RQ4将Thompson采样规则向50-50分配收缩在多大程度上能提高治疗效应检验的统计效能?
  • RQ5极限高斯Bandit表示是否可用于比较和优化自适应设计规则与推断程序?

主要发现

  • 极限高斯Bandit表示表征了序列自适应实验中所有可达极限分布,从而为推断与设计提供了统一框架。
  • 仅使用批次间均值差异的ZJM检验,在小替代假设下,对二维统计量的效能接近有限效能包络。
  • 池化均值差检验的效能始终高于ZJM检验,并趋近于四维数据的完整效能包络。
  • 将Thompson采样规则向50-50分配收缩(例如c=0.1)可缩小ZJM检验与最优效能包络之间的效能差距,尽管检验性能的相对排序保持不变。
  • 极限Bandit框架允许在不模拟完整原始数据生成过程的情况下,实现计算上可行的推断程序与自适应规则的比较。
  • 该表示具有普遍性,无需限制于特定规则(如贝叶斯或插补规则),可应用于最小最大遗憾或鲁棒偏好模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。