Skip to main content
QUICK REVIEW

[論文レビュー] Multiple imputation of multilevel missing data: An introduction to the R package pan

Simon Grund, Oliver Lüdtke|arXiv (Cornell University)|Jan 1, 2016
Statistical Methods and Bayesian Inference参考文献 72被引用数 67
ひとこと要約

この論文は、教育的・社会的科学分野における多層構造を有する欠損データの多重代入を可能にするRパッケージpanを紹介し、mitmlパッケージを用いた利用法を提示することで、アクセス性を向上させることを目的としている。多層構造を代入時に考慮することで、個別削除や単一レベルの代入と比較して、多層モデルの推定値におけるバイアスを低減し、妥当な統計的推論を維持できることを示している。

ABSTRACT

The treatment of missing data can be difficult in multilevel research because state-of-the-art procedures such as multiple imputation (MI) may require advanced statistical knowledge or a high degree of familiarity with certain statistical software. In the missing data literature, pan has been recommended for MI of multilevel data. In this article, we provide an introduction to MI of multilevel missing data using the R package pan, and we discuss its possibilities and limitations in accommodating typical questions in multilevel research. To make pan more accessible to applied researchers, we make use of the mitml package, which provides a user-friendly interface to the pan package and several tools for managing and analyzing multiply imputed data sets. We illustrate the use of pan and mitml with two empirical examples that represent common applications of multilevel models, and we discuss how these procedures may be used in conjunction with other software.

研究の動機と目的

  • 多層構造を有するデータに対する多重代入(MI)の適用という課題に取り組み、これは応用研究においてしばしば無視されている。
  • 特に非専門家向けのRユーザーにとって技術的複雑さが大きな障壁となる多層MI用パッケージpanの使用を克服すること。
  • panとmitmlパッケージの統合を示し、多重代入された多層データセットの代入、診断、分析をスムーズに行うためのワークフローを提供すること。
  • 代入段階で、群内および群間効果、およびランダムスロープといった多層構造を適切に扱うことで、推定値のバイアスを回避すること。
  • 複数の代入済みデータセットを統合するためのルビンのルールおよび代替手法(D1, D2, D3)を用いた実用的ガイドラインを提供し、複雑な仮説検定を実施すること。

提案手法

  • クラスタリングおよびランダム効果を考慮する多層混合モデル(MLMM)を用いて、panパッケージを用いて多層構造の多重代入を実行する。
  • mitmlパッケージをpanのユーザーフレンドリーなインターフェースとして活用し、構造的な代入ワークフローと自動収束診断を可能にする。
  • 学生水準の予測変数をグループ平均で中心化することで、多層モデルにおける群内および群間効果を分離する。
  • 補助変数を代入モデルに含め、多層構造を保持することで、分析モデルとの整合性を確保する。
  • ルビンのルールおよび代替手法(D1, D2, D3)を用いて、複数の代入済みデータセット間で回帰係数の推定値を統合し、仮説検定を実施する。
  • モデル比較や制約(例えば回帰係数の等価性)の検定を、多重代入データに適合するプーリング手順を用いて実施する。

実験結果

リサーチクエスチョン

  • RQ1多層構造を保持しつつ、多層データに対して多重代入を効果的に適用する方法は何か? また、推定値のバイアスを回避するにはどうすればよいか?
  • RQ2多層MI用パッケージpanの使用における実用的課題は何か? また、mitmlパッケージは、応用研究者にとってのアクセス性をどのように向上させるか?
  • RQ3代入段階で多層構造を無視すると、多層モデルにおける群内および群間効果の推定にどのような影響が生じるか?
  • RQ4複数のパラメータを含む複雑な仮説検定を実施する際、複数の代入済み多層データセットからの結果統合に利用可能な手法は何か?
  • RQ5ランダムスロープを持つモデルの予測変数に欠損データが生じた場合、現在の多層MIアプローチの限界は何か?

主な発見

  • 適切な多層代入モデルを用いてpanを適用することで、個別削除や単一レベル代入と比較して、多層モデルの推定値におけるバイアスが顕著に低減される。
  • mitmlパッケージは、panの効率的かつユーザーフレンドリーな実装を可能にし、収束診断および複数の代入済みデータセット間での結果統合を支援する。
  • グループレベルの構造を保持したまま多層データを代入することで、特にランダム切片およびランダムスロープを含むモデルにおいて、固定効果およびランダム効果の推定値がより正確になる。
  • 代入モデルに補助変数を含めることで、推定の効率性が向上し、多層関係の整合性を維持するのに役立つ。
  • D1, D2, D3といったプーリング手順により、複数の代入済みデータセット間で、モデル比較やパラメータ制約といった複雑な仮説検定についても妥当な推論が可能になる。
  • 技術的進展にもかかわらず、AICやBICといった適合度指標の推定や、ランダムスロープモデルの予測変数における欠損データの処理に関する課題は依然として残っており、今後の方法論的発展が求められている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。