[論文レビュー] How robust are Structural Equation Models to model miss-specification? A simulation study
このシミュレーション研究では、R の lavaan および piecewiseSEM を用いて、構造方程式モデル(SEMs)のモデル不適合に対するロバスト性を評価する。どの適合指標も単独では不適合を信頼性高く検出できないことが判明した。代わりに、特に BIC を組み合わせた複数の指標を用いることでモデル選択が向上し、効果を検出したり過適合・未適合を避けるためにも、十分なサンプルサイズ(100 以上)が不可欠である。
Structural Equation Models (SEMs) are routinely used in the analysis of empirical data by researchers from different scientific fields such as psychologists or economists. In some fields, such as in ecology, SEMs have only started recently to attract attention and thanks to dedicated software packages the use of SEMs has steadily increased. Yet, common analysis practices in such fields that might be transposed from other statistical techniques such as model acceptance or rejection based on p-value screening might be poorly fitted for SEMs especially when these models are used to confirm or reject hypotheses. In this simulation study, SEMs were fitted via two commonly used R packages: lavaan and piecewiseSEM. Five different data-generation scenarios were explored: (i) random, (ii) exact, (iii) shuffled, (iv) underspecified and (v) overspecified. In addition, sample size and model complexity were also varied to explore their impact on various global and local model fitness indices. The results showed that not one single model index should be used to decide on model fitness but rather a combination of different model fitness indices is needed. The global chi-square test for lavaan or the Fisher's C statistic for piecewiseSEM were, in isolation, poor indicators of model fitness. In addition, the simulations showed that to achieve sufficient power to detect individual effects, adequate sample sizes are required. Finally, BIC showed good capacity to select models closer to the truth especially for more complex models. I provide, based on these results, a flowchart indicating how information from different metrics may be combined to reveal model strength and weaknesses. Researchers in scientific fields with little experience in SEMs, such as in ecology, should consider and accept these limitations.
研究の動機と目的
- 現実的な生態学的データのシナリオにおける、一般的に用いられる SEM の適合指標がモデル不適合をどの程度うまく検出できるかを評価すること。
- サンプルサイズとモデルの複雑さが、グローバルおよびローカルの適合指標の性能に与える影響を調査すること。
- 情報基準(AIC、BIC、HBIC)が真のデータ生成過程に近いモデルをどの程度うまく選択できるかを比較すること。
- SEM 経験が限られた生態学など他の分野の研究者に対して、適合の解釈とモデルの改善に関する実用的ガイドラインを提供すること。
- カイ二乗検定やフィッシャーの C といった単一の適合統計量に依存するリスクを強調すること。
提案手法
- ランダム、正確、シャッフル、未適合、過適合の 5 つのデータ生成シナリオをシミュレートした。
- lavaan および piecewiseSEM パッケージにおける適合指標への影響を評価するため、サンプルサイズとモデルの複雑さを変動させた。
- グローバル適合指標(lavaan におけるカイ二乗、piecewiseSEM におけるフィッシャーの C)とローカル指標(パスの p 値、R2、条件付き独立性検定)を評価した。
- AIC、AICc、BIC、HBIC を用いて、複数のシナリオにおけるモデル選択性能を比較した。
- 比較可能性を確保するため、階層構造や潜在変数を含まない多変量正規分布に基づいてデータを生成した。
- 複数の指標を統合した意思決定フローチャートを開発し、モデルの評価と改善を支援する。
実験結果
リサーチクエスチョン
- RQ1さまざまなデータ生成シナリオにおいて、グローバル適合指標(例:lavaan におけるカイ二乗、piecewiseSEM におけるフィッシャーの C)は、モデル不適合をどの程度うまく検出できるか?
- RQ2サンプルサイズとモデルの複雑さは、SEM における個々のパス効果の検出力にどの程度影響を及えるか?
- RQ3さまざまな不適合状況下で、どの情報基準(AIC、AICc、BIC、HBIC)が真のモデルを最もよく特定できるか?
- RQ4ローカル適合指標(例:パスの p 値、R2、条件付き独立性検定)は、未適合または過適合の診断に役立つか?
- RQ5SEM のモデル改善に最も信頼性が高い指標の組み合わせは何か?
主な発見
- lavaan におけるカイ二乗検定や piecewiseSEM におけるフィッシャーの C といった、どのグローバル適合指標も、単独ではモデル不適合を信頼性高く検出できなかった。
- BIC は、特に複雑なモデルや大きなサンプルサイズ下で、真のデータ生成過程に近いモデルを選択する能力が最も高かった。
- サンプルサイズが 100 未満の場合は、個々のパス効果を検出する力が限定的であり、SEM 応用において十分なサンプルサイズの必要性が浮き彫りになった。
- AICc のモデル選択性能はサンプルサイズに応じて逆 J 字型のパターンを示したが、BIC および HBIC はサンプルサイズが大きくなるにつれて徐々に改善傾向を示した。
- グローバル p 値が高く、有意なパスが少ない一方で R2 が低いモデルは、信号の抽出が不十分であることを示しており、過適合または意味のある関係性が欠如している可能性を示唆した。
- 逆に、グローバル適合が悪いが、多くのパスが有意で R2 が高いモデルは、未適合または方向性の誤った仮定を示しており、関係性が欠落しているか、パスが誤って指定されている可能性を示唆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。