Skip to main content
QUICK REVIEW

[論文レビュー] semopy 2: A Structural Equation Modeling Package with Random Effects in Python

G. A. Meshcheryakov, Anna A. Igolkina|arXiv (Cornell University)|Jun 2, 2021
Statistical Methods and Applications参考文献 36被引用数 9
ひとこと要約

semopy 2 は、ランダム効果をネイティブにサポートする Python ベースの構造的方程式モデリング(SEM)フレームワークを導入し、複数の尤度および最小二乗法を用いて複雑な多層モデルを推定可能にした。従来の SEM を拡張し、行列分散正規分布をモデル化し、平均および分散構造の柔軟なパrameterization を通じてランダム効果を統合し、正規分布および非正規分布の仮定下で ML、FIML、ULS、GLS、WLS、DWLS の複数の推定法をサポートする。

ABSTRACT

Structural Equation Modeling (SEM) is an umbrella term that includes numerous multivariate statistical techniques that are employed throughout a plethora of research areas, ranging from social to natural sciences. Until recently, SEM software was either commercial or restricted to niche languages, and the lack of SEM packages compatible with more mainstream programming languages was dire. To combat that, we introduced a Python package semopy 1 that surpassed other state-of-the-art software in terms of performance and estimation accuracy. Yet, it was lacking in functionality and its usage was burdened with unnecessary boilerplate code. Here, we introduce a complete overhaul of semopy that improves upon the previous results and comes with lots of new capabilities. Furthermore, we propose a novel SEM model that combines in itself a notion of random effects from linear mixed models (LMMs) to model numerous phenomena, such as spatial data, time series or population stratification in genetics.

研究の動機と目的

  • Python における構造的方程式モデリングをランダム効果および多層データ構造をサポートするように拡張すること。
  • 行列分散正規モデルにおける平均および分散行列のパrameterization を可能にする柔軟なフレームワークを実装すること。
  • 正規および非正規仮定下で複数の推定法—ML、FIML、ULS、GLS、WLS、DWLS—をサポートすること。
  • 最近接正定値行列への補正を用いて欠損データおよび退化した分散共分散行列を堅牢に処理すること。
  • 多様な相関行列を用いた順序尺度変数のポリコリックおよびポリシリアル相関の使用を可能にすることにより、順序尺度変数の妥当なモデリングを実現すること。

提案手法

  • 行および列の共分散を表す L および T を用いて、行列分散正規分布を用いて平均および分散構造をパrameterize する。
  • スケール不変性を扱うためにトレース項を含めた、行列分散正規モデルの負の対数尤度関数を導出する。
  • REML 推定を可能にするために、射影行列 P₁ を用いた変換によりデータを再表現し、不偏な分散共分散推定を可能にする。
  • Wishart ML、FIML、ULS、GLS、WLS、DWLS の複数の損失関数を適用し、WLS では Browne (1984) が提唱した四次モーメントに基づく重みを用いる。
  • 対称行列のベクトル化に vech 演算子を用い、WLS/DWLS においてカスタム重み行列 W を許容する。
  • 退化または悪条件な分散共分散行列が検出された場合、最近接正定値行列に置き換えることでデータ補正を実施し、必要に応じて警告を出力する。

実験結果

リサーチクエスチョン

  • RQ1Python における構造的方程式モデリングフレームワーク内で、ランダム効果を効果的にモデル化する方法は何か?
  • RQ2正規性仮定が満たされない場合、多層または多変量データに対して最も適切な推定法は何か?
  • RQ3リストワイズ削除を避けて、SEM における欠損データを堅牢に処理する方法は何か?
  • RQ4順序尺度変数が存在する状況で、ポリコリックおよびポリシリアル相関を使用した場合、モデル推定に与える影響は何か?
  • RQ5行列分散正規分布を用いることで、多変量データの行および列の両方の依存性をどのようにモデル化できるか?

主な発見

  • 行列分散正規分布の ML 推定子が導出され、semopy 2 のデフォルト手法として実装された。尤度関数はトレース項を用いてスケール不変性を扱う。
  • 制限付き最大尤度(REML)は、P₁ を用いたデータ変換により実装され、変換後のモデルで残差共分散行列 L_R および T_R を推定することで実現される。
  • FIML はデータが完全な場合、多変量正規分布 ML と同等であるが、欠損データを観察ごとに欠損変数を除外することでより自然に処理できる。
  • WLS および DWLS は非正規性に対して頑健であり、特に重み行列が悪条件または大規模な場合、DWLS が特に有用である。
  • 標本分散共分散または相関行列が退化している場合、警告を出力し、最近接正定値行列に置き換えることで数値的安定性を確保する。
  • ポリコリックおよびポリシリアル相関の使用により、標本共分散行列を多様な相関行列に置き換えることで、順序尺度変数の妥当なモデリングが可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。