Skip to main content
QUICK REVIEW

[论文解读] On Using The Two-Way Cluster-Robust Standard Errors

Harold D. Chiang, Yuya Sasaki|arXiv (Cornell University)|Jan 31, 2023
Spatial and Panel Data Analysis被引用 4
一句话总结

本文通过为两向聚类三角阵列建立一个新颖的中心极限定理,为计量经济学分析中广泛使用两向聚类稳健标准误(TWCR)提供了理论依据。在温和且可解释的条件下——特别是当数据生成过程并非仅由少数均值为零的交互因子构成时——两向聚类均值的渐近分布被保证为正态分布,从而验证了在大多数实证情境中使用TWCR标准误的合理性。

ABSTRACT

Thousands of papers have reported two-way cluster-robust (TWCR) standard errors. However, the recent econometrics literature points out the potential non-gaussianity of two-way cluster sample means, and thus invalidity of the inference based on the TWCR standard errors. Fortunately, simulation studies nonetheless show that the gaussianity is rather common than exceptional. This paper provides theoretical support for this encouraging observation. Specifically, we derive a novel central limit theorem for two-way clustered triangular arrays that justifies the use of the TWCR under very mild and interpretable conditions. We, therefore, hope that this paper will provide a theoretical justification for the legitimacy of most, if not all, of the thousands of those empirical papers that have used the TWCR standard errors. We provide a guide in practice as to when a researcher can employ the TWCR standard errors.

研究动机与目标

  • 解决计量经济学文献中关于两向聚类下极限分布可能非正态性的担忧,这可能导致基于TWCR标准误的推断失效。
  • 为数千篇已发表论文中广泛采用TWCR标准误的实证实践提供理论支持,尤其是在存在多向依赖关系(如企业-市场或网络结构)的情境下。
  • 阐明两向聚类估计量渐近正态性的适用条件,从而明确研究人员在何种情况下可安全依赖TWCR推断。
  • 为两向聚类三角阵列开发一个新的中心极限定理,该类阵列与标准U统计量有本质不同,因其包含未观测到的随机分量和两样本结构。
  • 证明非正态性极为罕见,仅出现在涉及少量交互因子的特定病态情形中,从而验证了TWCR在实践中的稳健性。

提出的方法

  • 作者使用三角阵列建模数据生成过程,以捕捉两向聚类数据的渐近行为,其中聚类数量随时间增长。
  • 他们推导出两向聚类三角阵列均值的新中心极限定理(CLT),在温和的矩条件和依赖性条件下建立渐近正态性。
  • 证明依赖于鞅中心极限定理(Heyde和Brown,1970),需验证两个关键条件:四阶矩的统一可积性,以及条件二阶矩的方差趋于零。
  • 分析将两向聚类和分解为包含企业层面、市场层面和交互层面误差(a_s, b_s, w_is)的分量,并界定其对条件二阶矩方差的贡献。
  • 作者通过证明在假设2下,交叉项(如a_s w_is)的方差贡献在渐近下趋于零,从而验证了必要条件,该假设控制了误差结构的尾部行为。
  • 关键技术突破在于处理具有未观测核函数的两样本U统计量结构,这使得现有基于鞅或退化U统计量框架的CLT结果无法直接应用。

实验结果

研究问题

  • RQ1在何种条件下,两向聚类均值的渐近分布近似为正态分布?
  • RQ2在实证应用中,两向聚类下极限分布的非正态性是常见还是罕见现象?
  • RQ3能否将两向聚类稳健标准误的理论依据扩展至先前文献中使用的退化U统计量框架之外?
  • RQ4哪些特定的数据生成过程会导致两向聚类下出现非正态的渐近分布?
  • RQ5企业层面、市场层面和交互层面误差的相对贡献如何影响两向聚类估计量的渐近正态性?

主要发现

  • 在非常温和且可解释的条件下,两向聚类均值的渐近分布为正态分布,特别是当数据生成过程不退化为仅少数均值为零的交互因子之和时。
  • 非正态性在理论上是可能的,但极为罕见,仅出现在涉及极少数主导交互因子的病态情形中。
  • 在假设2下,条件二阶矩的方差渐近趋于零,从而满足鞅中心极限定理的关键条件。
  • 涉及企业效应和市场效应的交叉项(如a_s w_is)的贡献在渐近下可忽略不计,确保了极限分布保持正态性。
  • 该理论框架为在绝大多数实证应用中使用TWCR标准误提供了理论支持,包括市场结构、网络和面板数据等情境。
  • 本文的CLT结果并非现有退化U统计量CLT的特例,因其具有两样本和未观测核结构,因此需要基于鞅差分的全新证明策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。