Skip to main content
QUICK REVIEW

[论文解读] Efficient Bayesian Structural Equation Modeling in Stan

Edgar C. Merkle, Ellen Fitzsimmons|arXiv (Cornell University)|Aug 18, 2020
Advanced Statistical Modeling Techniques参考文献 42被引用 13
一句话总结

本文提出了一种新颖且高效的贝叶斯结构方程模型(SEM)方法,通过在Stan中对潜变量进行积分,显著提升了MCMC采样速度与效率,相较于以往的JAGS和Stan实现方法具有明显优势。该方法在多种模拟情景下表现优异,尤其在样本量增大时更为突出,原因在于其参数空间维度固定,与样本量无关。

ABSTRACT

Structural equation models comprise a large class of popular statistical models, including factor analysis models, certain mixed models, and extensions thereof. Model estimation is complicated by the fact that we typically have multiple interdependent response variables and multiple latent variables (which may also be called random effects or hidden variables), often leading to slow and inefficient MCMC samples. In this paper, we describe and illustrate a general, efficient approach to Bayesian SEM estimation in Stan, contrasting it with previous implementations in R package blavaan (Merkle & Rosseel, 2018). After describing the approaches in detail, we conduct a practical comparison under multiple scenarios. The comparisons show that the new approach is clearly better. We also discuss ways that the approach may be extended to other models that are of interest to psychometricians.

研究动机与目标

  • 为解决现有基于MCMC的Stan和JAGS中贝叶斯SEM估计效率低下的问题,尤其是在大样本或复杂模型情况下。
  • 开发一种基于Stan的新方法,通过边际化潜变量来提升采样效率,避免直接对这些高维参数进行采样。
  • 实现贝叶斯SEM的更快、更可扩展的估计,尤其适用于非正态结果或潜变量交互作用的模型。
  • 在blavaan R包中提供一个实用且开源的实现,便于与先前方法进行直接比较。
  • 探讨先验信息对模型协方差矩阵正定性及SEM MCMC采样后验校准的影响。

提出的方法

  • 该方法通过解析积分消去潜变量,将参数空间维度减少至仅包含结构模型与测量模型参数,从而避免直接采样潜变量。
  • 使用观测数据的边际似然函数,其为多元正态分布,均值与协方差矩阵由结构模型与测量模型参数推导得出。
  • 该方法利用Stan高效的哈密顿蒙特卡洛(HMC)采样器,通过将联合后验分布表示为与边际似然和先验密度成比例的形式。
  • 在Stan中通过重新参数化实现模型编码,确保计算稳定性与基于梯度采样的高效性。
  • 将该方法与两种先前方法进行对比:一种是使用JAGS对潜变量进行条件采样的方法,另一种是使用Stan直接采样潜变量的方法。
  • 该实现已集成至blavaan R包中,允许用户在不同方法间切换并比较性能。

实验结果

研究问题

  • RQ1在Stan中对潜变量进行积分是否能显著提升贝叶斯SEM的MCMC采样效率,相较于条件采样方法?
  • RQ2该新边际方法的性能如何随样本量增加而变化,尤其与条件方法相比?
  • RQ3先验分布对MCMC采样中模型隐含协方差矩阵正定性有何影响?
  • RQ4与blavaan中原始的JAGS和Stan实现相比,新的Stan方法在速度与效率上表现如何?
  • RQ5能否通过数据增广技术将该边际方法扩展至处理非正态观测变量(如有序变量)?

主要发现

  • 与blavaan中原始的JAGS和先前的Stan实现相比,新的边际Stan方法在所有测试情景下均显著更快、更高效。
  • 随着样本量增加,采样效率保持不变,因为参数空间维度与样本量无关;而条件方法中潜变量的引入会增加维度。
  • 该方法实现了更快的收敛速度,并更有效地探索后验分布,表现为更高的有效样本量和更低的R-hat值。
  • 该边际方法可可靠计算信息准则(如DIC和WAIC),这对模型比较至关重要。
  • 使用信息丰富的先验可能无意中诱导模型隐含协方差矩阵的正定性,凸显了先验信息丰富度与模型识别之间非直观的相互作用。
  • 未来通过数据增广技术处理非正态结果(如有序变量)的扩展是可行的,且有望进一步提升该方法的实际适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。