Skip to main content
QUICK REVIEW

[论文解读] Fast and Reliable Jackknife and Bootstrap Methods for Cluster-Robust Inference

James G. MacKinnon, Morten Ørregaard Nielsen|arXiv (Cornell University)|Jan 11, 2023
Statistical Methods and Inference被引用 7
一句话总结

本文提出了快速、计算高效的基于自助法的聚类稳健标准误估计方法(CRVEs),特别是CV3方法,并引入了新型的野质聚类自助法变体,以提升在小样本或不平衡聚类中的推断可靠性。主要贡献在于,这些方法——尤其是WCR-S自助法——在聚类大小不均或聚类数量较少时,相较于标准方法,能显著提高p值和置信区间的准确性。

ABSTRACT

We provide computationally attractive methods to obtain jackknife-based cluster-robust variance matrix estimators (CRVEs) for linear regression models estimated by least squares. We also propose several new variants of the wild cluster bootstrap, which involve these CRVEs, jackknife-based bootstrap data-generating processes, or both. Extensive simulation experiments suggest that the new methods can provide much more reliable inferences than existing ones in cases where the latter are not trustworthy, such as when the number of clusters is small and/or cluster sizes vary substantially. Three empirical examples illustrate the new methods.

研究动机与目标

  • 开发一种计算高效的CV3聚类自助法标准误估计方法,该方法在聚类数量少或聚类不平衡时通常比广泛使用的CV1方法更可靠。
  • 解决现有自助法的局限性,这些方法基于CV1,当聚类大小差异大或聚类数量少时可能导致不可靠的推断。
  • 提出新的野质聚类自助法变体,通过整合基于自助法的CRVEs或修改后的数据生成过程(DGPs),提升小样本性能。
  • 基于聚类平衡性和有效聚类数量,为CV3、CV1或自助法的使用提供实证指导。
  • 在Stata、R和Python中提供实用、可实现的解决方案,其在模拟和真实案例中的表现优于标准方法。

提出的方法

  • 通过显式利用聚类层面的残差和杠杆统计量,提出一种高效算法来计算聚类自助法估计量(CV3),即使在聚类数量众多的大样本中也能实现快速计算。
  • 推导出聚类自助法估计量与经验得分向量之间的代数关系,从而构建能更好反映真实底层结构的修改后自助法数据生成过程(DGPs)。
  • 提出两种新的野质聚类自助法变体:WCR-S和WCU-S,它们使用CV1标准误,但在自助法DGP中应用了自助法转换的得分向量,从而提升小样本性能。
  • 采用一种修改后的自助法DGP,限制各聚类内得分向量与设计矩阵正交,从而在聚类异质性条件下增强稳健性。
  • 在Stata、R、Python和Julia中实现新方法,开发高效软件包(如boottest、fwildclusterboot),支持10,000次以上的自助法重抽样,实现快速计算。
  • 通过广泛的模拟实验和三个实证应用验证方法性能,比较了不同聚类配置和样本规模下的表现。
Figure 1: Timings for three ways to compute CV 3
Figure 1: Timings for three ways to compute CV 3

实验结果

研究问题

  • RQ1如何高效计算聚类自助法估计量(CV3),使其在拥有大量聚类的大样本中仍具实用性?
  • RQ2基于CV3或修改后DGP的自助法是否在小样本或不平衡聚类中比基于CV1的标准野质聚类自助法提供更可靠的推断?
  • RQ3当聚类大小差异显著或聚类数量较少时,新自助法变体(如WCR-S)与经典方法(如WCR-C)的性能表现如何比较?
  • RQ4聚类不平衡、杠杆效应以及有效聚类数量对CV1与CV3标准误及p值可靠性有何影响?
  • RQ5在多样化的实证场景中,哪种自助法——WCR-S、WCR-C或其他——能提供最准确且稳健的推断?

主要发现

  • 在一个实证示例中,CV3标准误比CV1高出47%,表明在聚类不平衡时,推断结果存在显著差异。
  • WCR-S自助法(使用CV1标准误,但在DGP中采用自助法转换的得分向量)在模拟中始终优于经典WCR-C自助法,尤其在聚类不平衡时表现更优。
  • 新方法(如WCR-S)的自助法p值比基于CV1或CV3的传统t检验更可靠,尤其在聚类数量少或聚类大小差异大时。
  • 在模拟中,新方法降低了第一类错误率,并改善了置信区间的覆盖效果,特别是在聚类数量少或高度不平衡的场景中。
  • WCR-S自助法被发现是最具稳健性且实用的推荐方法,计算成本极低,且易于实现。
  • 10,000次以上的自助法重抽样在计算上是可行的,且对可靠推断至关重要,尤其是在聚类结构复杂时。
Figure 2: Rejection frequencies as a function of $\gamma$
Figure 2: Rejection frequencies as a function of $\gamma$

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。