Skip to main content
QUICK REVIEW

[论文解读] Stratification Trees for Adaptive Randomization in Randomized Controlled Trials

Max Tabord‐Meehan|arXiv (Cornell University)|Jun 13, 2018
Advanced Causal Inference Techniques被引用 9
一句话总结

本文提出一种基于分层树的、数据驱动的自适应随机化方法,用于两阶段随机对照试验——该方法通过基于决策树的协变量分区,优化治疗分配概率,以最小化平均治疗效应(ATE)估计的方差。利用第一阶段数据学习最优分层树及相应的分配概率,该方法在一类决策树分层结构中实现了渐近最小方差,即使在受限制的随机化方案(如分层区块随机化)下亦成立。

ABSTRACT

This paper proposes an adaptive randomization procedure for two-stage randomized controlled trials. The method uses data from a first-wave experiment in order to determine how to stratify in a second wave of the experiment, where the objective is to minimize the variance of an estimator for the average treatment effect (ATE). We consider selection from a class of stratified randomization procedures which we call stratification trees: these are procedures whose strata can be represented as decision trees, with differing treatment assignment probabilities across strata. By using the first wave to estimate a stratification tree, we simultaneously select which covariates to use for stratification, how to stratify over these covariates, as well as the assignment probabilities within these strata. Our main result shows that using this randomization procedure with an appropriate estimator results in an asymptotic variance which is minimal in the class of stratification trees. Moreover, the results we present are able to accommodate a large class of assignment mechanisms within strata, including stratified block randomization. In a simulation study, we find that our method, paired with an appropriate cross-validation procedure ,can improve on ad-hoc choices of stratification. We conclude by applying our method to the study in Karlan and Wood (2017), where we estimate stratification trees using the first wave of their experiment.

研究动机与目标

  • 开发一种自适应随机化程序,以最小化两阶段随机对照试验中ATE估计量的方差。
  • 同时选择用于分层的相关协变量,通过决策树确定最优分层,并确定各分层内的最优治疗分配概率。
  • 在保证理论与计算可及性的同时,兼容如分层区块随机化等受限制的随机化方法。
  • 通过机器学习启发的技术实现数据驱动的优化,改进现有非系统性分层选择。
  • 将方法扩展至提高子群体特异性治疗效应估计的效率。

提出的方法

  • 使用遗传算法在基于决策树的分层程序(即分层树)的类中搜索,以找到协变量空间的最优划分。
  • 基于ATE估计量渐近方差的交叉验证估计量设计适应度函数,以指导树的选择。
  • 应用变异算子——分裂、剪枝、小规模/大规模变异及交叉,使树种群向更低方差的设计演化。
  • 通过将无效分层的方差设为无穷大,施加最小单元大小约束(例如,每个分层中每种治疗至少两个观测值),以确保实际可行性。
  • 采用两阶段设计:第一阶段数据用于训练分层树,随后用于指导第二阶段的随机化与估计。
  • 借鉴Bugni等人(2018)的方法,处理因受限制的随机化(如分层区块随机化)在分层内引入的依赖性。

实验结果

研究问题

  • RQ1能否利用第一阶段实验数据,通过数据驱动方法识别出一种最优分层树,以最小化ATE估计量的渐近方差?
  • RQ2与非系统性或固定分层选择相比,所提出方法在方差减少与效率方面表现如何?
  • RQ3该方法在多大程度上可兼容如分层区块随机化等受限制的随机化方案,同时保持理论最优性?
  • RQ4该方法能否扩展以提高子群体特异性治疗效应估计的效率?
  • RQ5该方法对模型误设或有限样本下偏离渐近理论的情况有多强的稳健性?

主要发现

  • 在正则性条件下,所提出的自适应随机化程序在所有分层树中实现了渐近最小方差。
  • 在模拟研究中,该方法显著优于非系统性分层选择,通过优化树结构与治疗分配概率,显著降低了估计量方差。
  • 在模拟中,该方法成功识别出最优不可行树,其方差接近理论最小值,如图9–11所示(模型1–3)。
  • 在Karlan与Wood(2017)的应用中,该方法基于预赠与金额估计出分层树,治疗分配概率分别为0.48与0.86,相较于标准方法提高了效率。
  • 在所有情况下,算法均在5000次迭代内收敛,终止条件为连续50次迭代中前5%的最优树保持稳定。
  • 该方法在受限制随机化下依然有效,包括分层区块随机化,如理论扩展所示,其结果与现有渐近理论一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。