Skip to main content
QUICK REVIEW

[論文レビュー] Multiple imputation for multilevel data with continuous and binary variables

Vincent Audigier, Ian R. White|TNO Repository|Feb 3, 2017
Statistical Methods and Bayesian Inference参考文献 49被引用数 11
ひとこと要約

本稿は、連続変数および二値変数を含む多次元データにおける複数代入(MI)手法を、体系的欠損と断続的欠損の下で評価し、統合モデル化(JM)と完全条件指定(FCS)アプローチを比較する。非等分散MI手法が等分散手法を上回ること、および手法の選択はクラスターサイズと欠損データのパターンに依存することを明らかにした。JM-jomoとFCS-2stageは、異なる条件下で優れた性能を示した。

ABSTRACT

We present and compare multiple imputation methods for multilevel continuous and binary data where variables are systematically and sporadically missing. The methods are compared from a theoretical point of view and through an extensive simulation study motivated by a real dataset comprising multiple studies. Simulations are reproducible. The comparisons show why these multiple imputation methods are the most appropriate to handle missing values in a multilevel setting and why their relative performances can vary according to the missing data pattern, the multilevel structure and the type of missing variables. This study shows that valid inferences can only be obtained if the dataset gathers a large number of clusters. In addition, it highlights that heteroscedastic MI methods provide more accurate inferences than homoscedastic methods, which should be reserved for data with few individuals per cluster. Finally, the method of Quartagno and Carpenter (2016a) appears generally accurate for binary variables, the method of Resche-Rigon and White (2016) with large clusters, and the approach of Jolani et al. (2015) with small clusters.

研究の動機と目的

  • 体系的欠損と断続的欠損の下で、連続および二値変数を含む多次元データに対する複数代入(MI)手法を評価・比較すること。
  • 多次元構造、クラスターサイズ、欠損データのパターンが代入の正確性および推論の妥当性に与える影響を評価すること。
  • 欠損データが体系的または断続的に発生する多次元設定において、どのMI手法が妥当な統計的推論を提供するかを特定すること。
  • 非等分散性および事前分布の仮定の違いを含むさまざまな条件下で、統合モデル化(JM)と完全条件指定(FCS)アプローチのパフォーマンスを調査すること。
  • データ構造、クラスターサイズ、欠損値の割合に基づいてMI手法を選択するための実用的勧告を提供すること。

提案手法

  • クラスタリングを考慮した多次元代入モデルに基づき、M個の完全なデータセットを生成する複数代入(MI)を用いる。
  • 特に、共役事前分布を用いた多変量正規分布を用いるJM-jomoを含む、統合モデル化(JM)アプローチと、FCS-GLM、FCS-2stage、FCS-2lnormを含むFCSベースの手法を比較する。
  • 連続変数はランダム切片を伴う線形混合モデルを用いて代入し、二値変数は多次元フレームワーク内でのprobitまたはlogitリンク関数を用いる。
  • 推論のための適切な分散推定を保証するために、ルービンのルールを用いて複数の代入データセットの推定値を統合する。
  • GREATネットワークの実際の多次元データセットに基づくシミュレーションスタディを実施し、クラスターサイズ、欠損データのパターン、変数タイプの違いに応じたパフォーマンスを評価する。
  • クラスタごとに分散成分が変化することを許容する非等分散MIモデルを用い、等分散モデルよりも正確性が向上することを示す。

実験結果

リサーチクエスチョン

  • RQ1体系的欠損と断続的欠損の下で、連続および二値変数を含む多次元データにおいて、異なる複数代入手法はどのように性能を発揮するか?
  • RQ2クラスターサイズは、多次元設定における複数代入からの正確性および推論の妥当性にどのような影響を与えるか?
  • RQ3非等分散と等分散の代入モデルは、多次元データにおける信頼区間のカバレッジとバイアスの観点から、どのように比較されるか?
  • RQ4JM-jomo、FCS-2stage、FCS-GLM、FCS-2lnormのうち、どの代入手法が、さまざまな欠損データパターン下で二値変数の推論において最も正確か?
  • RQ5FCSベースの手法が失敗する条件は何か?また、どのような状況で統合モデル化が好ましいか?

主な発見

  • 多次元データにおける複数代入からの妥当な推論には、多数のクラスタが必要である。クラスタ数が少ない場合、分散推定がバイアスを示し、カバレッジが悪化する。
  • 非等分散MI手法は、クラスタレベルの分散に差がある場合、等分散手法よりも正確な推論を提供する。
  • JM-jomo手法は、特にクラスタ数と欠損のある二値変数の数が多い場合、二値変数の代入において一般的に正確である。
  • FCS-2stageは大規模なクラスタでは良好に機能するが、クラスタが小さい場合、または断続的欠損の割合が高い場合には避けるべきである。
  • FCS-GLMは小規模なクラスタでは優れた性能を示すが、特にprobitリンク関数を用いる場合に顕著である。
  • FCS-2lnormはランダム係数の変動性を低く見積もるため、体系的欠損があるデータセットには不適切である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。