[论文解读] A general theory of regression adjustment for covariate-adaptive randomization: OLS, Lasso, and beyond
本文为协变量自适应随机化实验中的回归校正建立了一般理论,即使在模型误设和高维协变量下,也能通过普通最小二乘法(OLS)和Lasso实现稳健且高效的效应估计。该理论建立了渐近正态性,并提出了一致的方差估计量,证明了在分层区块和最小化设计等多种随机化方法下,其效率和有效性均得到提升。
We consider the problem of estimating and inferring treatment effects in randomized experiments. In practice, stratified randomization, or more generally, covariate-adaptive randomization, is routinely used in the design stage to balance the treatment allocations with respect to a few variables that are most relevant to the outcomes. Then, regression is performed in the analysis stage to adjust the remaining imbalances to yield more efficient treatment effect estimators. Building upon and unifying the recent results obtained for ordinary least squares adjusted estimators under covariate-adaptive randomization, this paper presents a general theory of regression adjustment that allows for arbitrary model misspecification and the presence of a large number of baseline covariates. We exemplify the theory on two Lasso-adjusted treatment effect estimators, both of which are optimal in their respective classes. In addition, nonparametric consistent variance estimators are proposed to facilitate valid inferences, which work irrespective of the specific randomization methods used. The robustness and improved efficiency of the proposed estimators are demonstrated through a simulation study and a clinical trial example. This study sheds light on improving treatment effect estimation efficiency by implementing machine learning methods in covariate-adaptive randomized experiments.
研究动机与目标
- 为协变量自适应随机化实验中的回归校正建立统一框架,即使在任意模型误设下依然有效。
- 将稳健推断扩展至协变量数量超过样本量的高维设置,克服传统OLS的局限性。
- 提出非参数、一致的方差估计量,确保无论采用何种具体随机化方法,推断均有效。
- 通过模拟研究和真实临床试验数据,证明Lasso校正估计量在效率和稳健性方面的优势。
- 统一并推广先前关于协变量自适应随机化下OLS校正估计量的研究成果,提升其适用范围。
提出的方法
- 提出协变量自适应随机化中回归校正的一般框架,允许任意模型误设和高维协变量。
- 在较弱的正则性条件下,推导OLS和Lasso校正效应估计量的渐近正态性,确保推断有效。
- 引入不依赖于具体随机化机制的非参数、一致方差估计量,实现稳健推断。
- 将理论应用于两种Lasso校正估计量:一种在各层使用统一模型,另一种使用分层特定模型,两者在各自类别中均被证明为最优。
- 采用有限总体框架建模潜在结果和处理分配,实现实验设计驱动的推断。
- 通过模拟研究和一项真实临床试验(Nefazodone CBASP)验证理论结果,并比较不同随机化方法下的性能表现。
实验结果
研究问题
- RQ1在协变量自适应随机化下,即使协变量维度较高,使用Lasso的回归校正是否仍能提供有效的、高效的效应推断?
- RQ2在各种随机化方案下,Lasso校正估计量相对于OLS和未校正估计量在偏差、标准误和置信区间覆盖概率方面的表现如何?
- RQ3能否构建一致的、非参数的方差估计量,以确保无论底层随机化方法如何,推断均有效?
- RQ4模型误设对协变量自适应设计中回归校正估计量性能有何影响?
- RQ5当协变量数量较大时,Lasso校正估计量是否比未校正或OLS校正估计量具有更高的效率?
主要发现
- 与未校正估计量相比,Lasso校正估计量表现出可忽略的偏差,并显著降低标准误,尤其在高维设置下更为明显。
- 基于所提方差估计量构建的95%置信区间的覆盖概率在所有随机化方法和样本量下均接近名义水平(约0.95)。
- 所提出的非参数方差估计量在模型误设和复杂随机化方案下仍能保持准确的大小和覆盖性能。
- 在样本量n=500、π=2/3的模拟中,Lasso校正估计量的标准误约为0.39–0.40,而未校正估计量为1.17–1.19,表明效率有显著提升。
- 模拟结果表明,当协变量数量较大且模型可能误设时,Lasso校正估计量在效率方面优于OLS校正估计量。
- 真实世界Nefazodone CBASP临床试验数据验证了理论发现,表明Lasso校正能获得比未校正或OLS校正方法更精确、更稳健的效应估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。