[论文解读] semopy 2: A Structural Equation Modeling Package with Random Effects in Python
semopy 2 引入了一个基于 Python 的结构方程模型(SEM)框架,原生支持随机效应,可通过多种似然函数和最小二乘法估计复杂多层模型。它通过灵活参数化均值和协方差结构,将矩阵变量子正态分布纳入传统 SEM 框架,支持在正态与非正态假设下使用 ML、FIML、ULS、GLS、WLS 和 DWLS 等多种估计方法。
Structural Equation Modeling (SEM) is an umbrella term that includes numerous multivariate statistical techniques that are employed throughout a plethora of research areas, ranging from social to natural sciences. Until recently, SEM software was either commercial or restricted to niche languages, and the lack of SEM packages compatible with more mainstream programming languages was dire. To combat that, we introduced a Python package semopy 1 that surpassed other state-of-the-art software in terms of performance and estimation accuracy. Yet, it was lacking in functionality and its usage was burdened with unnecessary boilerplate code. Here, we introduce a complete overhaul of semopy that improves upon the previous results and comes with lots of new capabilities. Furthermore, we propose a novel SEM model that combines in itself a notion of random effects from linear mixed models (LMMs) to model numerous phenomena, such as spatial data, time series or population stratification in genetics.
研究动机与目标
- 将 Python 中的结构方程建模扩展至支持随机效应和多层数据结构。
- 实现一个灵活的框架,用于参数化矩阵变量子正态模型中的均值和协方差矩阵。
- 在正态与非正态假设下,支持多种估计方法——ML、FIML、ULS、GLS、WLS 和 DWLS。
- 通过最近正定矩阵修正,实现对缺失数据和退化协方差矩阵的稳健处理。
- 通过异质相关矩阵支持多项点点相关和多项点序相关,以实现对有序变量的有效建模。
提出的方法
- 使用矩阵变量子正态分布参数化均值和协方差结构,其中 L 和 T 分别表示行和列的协方差。
- 推导矩阵变量子正态模型的负对数似然函数,通过迹项处理尺度不变性问题。
- 通过投影矩阵 P₁ 的变换实现 REML 估计,从而实现无偏协方差估计。
- 应用多种损失函数:Wishart ML、FIML、ULS、GLS、WLS 和 DWLS,其中 WLS 使用 Browne(1984)提出的基于四阶矩的权重。
- 采用 vech 算子将对称矩阵向量化,并在 WLS/DWLS 中允许自定义权重矩阵 W。
- 通过将退化或病态协方差矩阵替换为最近的正定矩阵实现数据修正,并在必要时发出警告。
实验结果
研究问题
- RQ1如何在 Python 的结构方程建模框架中有效建模随机效应?
- RQ2当正态性假设被违反时,哪些估计方法最适合多层或多变量数据?
- RQ3如何在 SEM 中稳健处理缺失数据,避免列表删除法?
- RQ4在存在有序变量的情况下,使用多项点点相关和多项点序相关对模型估计有何影响?
- RQ5如何利用矩阵变量子正态分布对多变量数据中的行和列依赖关系进行建模?
主要发现
- 矩阵变量子正态 ML 估计器已推导并实现为 semopy 2 的默认方法,其似然函数通过迹项处理尺度不变性。
- 通过 P₁ 对数据进行变换,支持限制最大似然(REML)估计,从而在变换模型下估计残差协方差 L_R 和 T_R。
- FIML 在数据完整时等价于多元正态 ML,但能更自然地处理缺失数据,即按观测值逐个排除缺失变量。
- WLS 和 DWLS 对非正态性具有稳健性,尤其当权重矩阵病态或规模较大时,DWLS 表现更优。
- 当样本协方差或相关矩阵退化时,框架会发出警告,并将其替换为最近的正定矩阵,以确保数值稳定性。
- 使用多项点点相关和多项点序相关可将样本协方差矩阵替换为异质相关矩阵,从而实现对有序变量的有效建模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。