[論文レビュー] Pooling multiple imputations when the sample happens to be the population
本稿では、標本が母集団全体である場合の多重代入における簡略化されたプーリング規則を提案し、推論から標本抽出の分散を排除する。欠損データに起因するばらつきのみに注目することで、従来のルービンの規則が過大に分散を推定し、有限母集団設定における統計的検出力の低下を引き起こすのを防ぎ、より短くかつ正確に被覆される信頼区間を生成する。
Current pooling rules for multiply imputed data assume infinite populations. In some situations this assumption is not feasible as every unit in the population has been observed, potentially leading to over-covered population estimates. We simplify the existing pooling rules for situations where the sampling variance is not of interest. We compare these rules to the conventional pooling rules and demonstrate their use in a situation where there is no sampling variance. Using the standard pooling rules in situations where sampling variance should not be considered, leads to overestimation of the variance of the estimates of interest, especially when the amount of missingness is not very large. As a result, populations estimates are over-covered, which may lead to a loss of statistical power. We conclude that the theory of multiple imputation can be extended to the situation where the sample happens to be the population. The simplified pooling rules can be easily implemented to obtain valid inference in cases where we have observed essentially all units and in simulation studies addressing the missingness mechanism only.
研究の動機と目的
- すべての母集団ユニットが観察されている状況で、多重代入における分散の過大評価を是正し、過剰被覆の生じる信頼区間を解消すること。
- 標本抽出の分散を除外し、欠損データ機構に起因するばらつきのみに焦点を当てた、簡略化されたプーリング規則の開発と検証すること。
- 標本抽出の分散が無関係な状況(完全なレジストリや欠損データ機構のシミュレーション研究など)において、統計的効率性と検出力を向上させること。
- 有限母集団の文脈において、従来のルービンの規則の代わりに、数学的に明快で実用的な代替手段を提供すること。
提案手法
- 標本が母集団全体である場合、標本抽出の分散が存在しないため、平均内部代入分散 $\bar{U}$ を 0 に設定する修正されたプーリング規則を提案する。
- ルービンの分散分解を用いるが、$\bar{U}$ を無視するため、合計分散は $T = B + B/m$ となる。ここで $B$ は代入間分散である。
- パラメータの目的の合計分散を推定するために、簡略化された規則を適用し、自由度は $\nu = m - 1$ とする。
- 非応答に起因する分散の相対的増加を $r = \infty$ と定義し、標本抽出の分散が存在しないことを反映する。
- 多変量正規分布データを用いた $N=1000$ の有限母集団を用いたシミュレーションにより、本手法を検証する。欠損率は 10% から 95% まで変化させる。
- 10,000回のシミュレーションにおいて、従来のルービンの規則と比較し、被覆性、信頼区間幅、統計的検出力を評価する。
実験結果
リサーチクエスチョン
- RQ1標本が母集団全体である場合、従来のルービンのプーリング規則は、不要な標本抽出の分散を含めるため、分散を過大に推定し、過剰被覆の信頼区間を生じるか?
- RQ2標本抽出の分散を除外する簡略化されたプーリング規則は、有限母集団設定において統計的検出力と精度を向上させることができるか?
- RQ3欠損率の異なる水準において、簡略化されたプーリング規則と従来のプーリング規則の被覆性および区間幅の性能はどのように異なるか?
- RQ4標本抽出の分散が存在しない、欠損データ機構に特化したシミュレーション研究において、簡略化された規則は適切に機能するか?
- RQ5欠損率が上昇するにつれて、合計分散における代入間分散 ($B$) と内部代入分散 ($\bar{U}$) の相対的寄与度はどのように変化するか?
主な発見
- すべての母集団ユニットが観察されている場合、従来のルービンの規則は、不要な標本抽出の分散を含めるため、95%信頼区間が過剰被覆され、被覆率が95%を超える(例:10%欠損時で1.000)。
- 簡略化されたプーリング規則は、すべての欠損率レベルで正確な95%被覆を達成し、被覆率が一貫して約0.95に保たれる。これは有効な推論を示している。
- 簡略化された規則では、従来の規則と比較して信頼区間が顕著に狭くなる。例として、$Y_1$ について10%欠損時、区間幅は0.06 vs. 0.13である。これは統計的検出力の向上を示す。
- 欠損率が上昇するにつれて、$\bar{U}$ が合計分散に与える寄与度は減少し、従来の規則の自由度は $m-1$ に近づき、簡略化された規則に収束する。
- すべてのデータが欠損している場合、両方のプーリング手法は同値となる。$\bar{U} = 0$ かつ $r = \infty$ であるため、極端な状況でも一貫性が保証される。
- 本手法は、標本抽出の分散をモデル化する複雑さを回避しつつ、有効な推論を維持できるため、欠損データ機構に特化したシミュレーション研究において特に有益である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。