Skip to main content
QUICK REVIEW

[论文解读] Bootstrapping Clustered Data in R using lmeresampler

Adam Loy, Jenna Korobova|arXiv (Cornell University)|Jun 11, 2021
Bayesian Methods and Mixture Models被引用 12
一句话总结

本论文介绍了 lmeresampler 包,用于在 R 中对线性混合效应模型进行自助抽样,提供五种适用于聚类数据的重采样方法——案例、残差、参数、野蛮和区块自助法。该包支持偏差校正推断、置信区间估计以及参数函数的估计,并通过 doParallel 和 foreach 实现并行计算。

ABSTRACT

Linear mixed-effects models are commonly used to analyze clustered data structures. There are numerous packages to fit these models in R and conduct likelihood-based inference. The implementation of resampling-based procedures for inference are more limited. In this paper, we introduce the lmeresampler package for bootstrapping nested linear mixed-effects models fit via lme4 or nlme. Bootstrap estimation allows for bias correction, adjusted standard errors and confidence intervals for small samples sizes and when distributional assumptions break down. We will also illustrate how bootstrap resampling can be used to diagnose this model class. In addition, lmeresampler makes it easy to construct interval estimates of functions of model parameters.

研究动机与目标

  • 为解决 R 中线性混合效应(LME)模型缺乏可访问、用户友好的自助抽样程序的问题,特别是针对聚类或多层次数据。
  • 为使用 lme4 或 nlme 拟合的 LME 模型,提供一个统一、易于使用的接口,支持多种自助抽样方法(案例、残差、参数、野蛮、区块)。
  • 在分布假设不成立或样本量较小时,实现稳健的统计推断——特别是偏差校正、标准误调整和置信区间估计。
  • 支持对模型参数的复杂函数(如重复性)进行估计,采用基于重采样的方法。
  • 通过与 doParallel 和 foreach 集成,支持并行自助抽样,提升大规模重采样在 LME 模型中的计算效率。

提出的方法

  • lmeresampler 包实现了五种自助抽样程序:案例(非参数)、残差、参数、野蛮和区块自助法,均适用于嵌套的高斯 LME 模型。
  • bootstrap() 函数作为统一接口,允许用户指定自助抽样类型(例如 type = 'parametric')和重采样次数(B)。
  • 对于参数自助法,该包使用拟合模型的估计参数(β̂, D̂, σ̂²)从条件分布 y|b ~ N(Xβ + Zb, σ²I) 中模拟新的响应向量 y*。
  • 残差和野蛮自助法通过重采样残差(边际或条件)生成新的响应数据,保留模型的误差结构。
  • 区块自助法通过重采样整个观测簇来保持簇级别的依赖性,从而维持分层结构。
  • 该包通过 combine_lmeresamp() 工具函数支持并行化处理,该函数可将使用 foreach 和 doParallel 在多个核心上执行的多个自助抽样运行结果合并为单一的 lmeresamp 对象。

实验结果

研究问题

  • RQ1如何有效将自助抽样应用于具有聚类数据的线性混合效应模型,以在小样本量或分布假设不成立时改善推断?
  • RQ2对于嵌套的 LME 模型,最合适的自助抽样方法(如参数、残差、区块)是什么?它们在偏差校正和覆盖性能方面如何比较?
  • RQ3是否可以通过一个单一、用户友好的 R 包,统一访问多种 LME 模型的自助抽样程序,从而减少对自定义编码或外部软件的依赖?
  • RQ4如何在 R 中高效并行化自助抽样,以减少大规模 LME 模型重采样所需的计算时间?
  • RQ5是否可以使用基于自助抽样的方法,对模型参数的复杂函数(如重复性)进行可靠置信区间估计?

主要发现

  • lmeresampler 包成功在 R 中实现了五种自助抽样方法——案例、残差、参数、野蛮和区块自助法,适用于嵌套线性混合效应模型。
  • 在 JSP 数据集中,lmeresampler 的参数自助法对固定效应 'time' 生成了 95% 置信区间 [0.299, 0.480],展示了实际的区间估计能力。
  • 该包支持通过自助法置信区间对模型参数的函数(如重复性)进行估计,如在甲虫数据集示例中所示。
  • 使用双核并行处理,2000 次自助抽样迭代的运行时间从单核的 ~38.8 秒减少至 ~19.3 秒,加速比约为 2.01。
  • combine_lmeresamp() 函数能有效将多个并行自助抽样运行的结果合并为一个单一的 lmeresamp 对象,支持一致的后续分析。
  • 该包通过 glmer() 支持广义线性混合模型(GLMMs)的案例、残差和参数自助法,以及具有交叉随机效应模型的参数自助法,但在这些情况下性能可能不理想。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。