Skip to main content
QUICK REVIEW

[论文解读] Multiple imputation of multilevel missing data: An introduction to the R package pan

Simon Grund, Oliver Lüdtke|arXiv (Cornell University)|Jan 1, 2016
Statistical Methods and Bayesian Inference参考文献 72被引用 67
一句话总结

本文介绍了 R 包 pan,用于对多层次缺失数据进行多重插补,并通过 mitml 包展示其使用方法,以提高可及性。结果表明,在插补过程中考虑多层次结构可保持有效的统计推断,与成对删除或单层次插补相比,能显著减少多层次模型估计中的偏差。

ABSTRACT

The treatment of missing data can be difficult in multilevel research because state-of-the-art procedures such as multiple imputation (MI) may require advanced statistical knowledge or a high degree of familiarity with certain statistical software. In the missing data literature, pan has been recommended for MI of multilevel data. In this article, we provide an introduction to MI of multilevel missing data using the R package pan, and we discuss its possibilities and limitations in accommodating typical questions in multilevel research. To make pan more accessible to applied researchers, we make use of the mitml package, which provides a user-friendly interface to the pan package and several tools for managing and analyzing multiply imputed data sets. We illustrate the use of pan and mitml with two empirical examples that represent common applications of multilevel models, and we discuss how these procedures may be used in conjunction with other software.

研究动机与目标

  • 解决在应用研究中常被忽视的将多重插补(MI)应用于多层次数据的挑战。
  • 克服非专业 R 用户在使用 pan 包进行多层次 MI 时面临的技术复杂性障碍。
  • 展示 pan 与 mitml 包的集成,以简化多层次多重插补数据集的插补、诊断与分析工作流。
  • 说明在插补过程中正确处理多层次结构(如组内与组间效应、随机斜率)的方法,以避免估计偏差。
  • 提供关于如何使用 Rubin 法则及替代方法(D1、D2、D3)合并多重插补数据集结果的实用指导,适用于复杂假设检验。

提出的方法

  • 使用 pan 包通过多层次混合模型(MLMM)执行多层次多重插补,以考虑聚类效应和随机效应。
  • 利用 mitml 包作为 pan 的用户友好接口,支持结构化插补工作流和自动收敛诊断。
  • 将学生层面的预测变量围绕组均值进行中心化处理,以在多层次模型中分离组内与组间效应。
  • 在插补模型中纳入辅助变量并保持多层次结构,以确保与分析模型的兼容性。
  • 应用 Rubin 法则及替代方法(D1、D2、D3)对多个插补数据集中的参数估计进行合并,并检验假设。
  • 使用与多重插补数据兼容的合并程序,进行模型比较并检验约束条件(如回归系数相等性)。

实验结果

研究问题

  • RQ1如何在保留层级结构的同时有效应用多重插补于多层次数据,以避免参数估计中的偏差?
  • RQ2使用 pan 包进行多层次 MI 的实际挑战是什么?mitml 包如何提升应用研究者的可及性?
  • RQ3在插补过程中忽略多层次结构会对多层次模型中组内与组间效应的估计产生何种影响?
  • RQ4在测试涉及多个参数的复杂假设时,有哪些方法可用于合并多重插补的多层次数据集结果?
  • RQ5当随机斜率模型的预测变量中存在缺失数据时,当前多层次 MI 方法存在哪些局限性?

主要发现

  • 使用 pan 配合适当的多层次插补模型,与成对删除或单层次插补相比,能显著减少多层次模型估计中的偏差。
  • mitml 包可实现 pan 的高效且用户友好的应用,支持收敛诊断,并能对多个插补数据集的结果进行合并。
  • 在保留组级别结构的前提下插补多层次数据,可更准确地估计固定效应与随机效应,尤其在具有随机截距和斜率的模型中表现更优。
  • 在插补模型中纳入辅助变量可提高估计效率,并有助于保持多层次关系的完整性。
  • D1、D2 和 D3 等合并程序可对多重插补数据集中的复杂假设(如模型比较和参数约束)实现有效的统计推断。
  • 尽管已有进展,但在估计拟合指标(如 AIC、BIC)以及处理随机斜率模型中预测变量的缺失数据方面仍存在挑战,表明仍需进一步的方法学发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。