[論文レビュー] A Copula-based Imputation Model for Missing Data of Mixed Type in Multilevel Data Sets
本論文は、連続変数、順序尺度変数、名義尺度変数を含む混合変数タイプの多段階データに対して、クラスタリングを考慮したランダム効果を組み込んだコプシラベースの補完モデルを提案する。潜在変数フレームワークと拡張ランク尤度、ギブスサンプリングを用いることで、従来の手法と比較して補完精度とパラメータ回復が向上し、特に組内相関が高くなる状況でも有効である。
We propose a copula based method to handle missing values in multivariate data of mixed types in multilevel data sets. Building upon the extended rank likelihood of \cite{hoff2007extending} and the multinomial probit model, our model is a latent variable model which is able to capture the relationship among variables of different types as well as accounting for the clustering structure. We fit the model by approximating the posterior distribution of the parameters and the missing values through a Gibbs sampling scheme. We use the multiple imputation procedure to incorporate the uncertainty due to missing values in the analysis of the data. Our proposed method is evaluated through simulations to compare it with several conventional methods of handling missing data. We also apply our method to a data set from a cluster randomized controlled trial of a multidisciplinary intervention in acute stroke units. We conclude that our proposed copula based imputation model for mixed type variables achieves reasonably good imputation accuracy and recovery of parameters in some models of interest, and that adding random effects enhances performance when the clustering effect is strong.
研究の動機と目的
- 連続変数、順序尺度変数、名義尺度変数を含む混合変数タイプの多段階データにおいて、クラスタ構造を考慮した欠損データの処理を目的とする。
- ホフ(2007)のコプシラベースの拡張ランク尤度を拡張し、クラスタレベルの相関を扱うためのランダム効果を組み込む。
- 潜在変数フレームワークに多項プロビットモデルを適用することで、名義尺度変数を処理するモデルを構築する。
- シミュレーションと脳卒中ケア試験の実データを用いて、補完精度とパラメータ回復の性能を評価する。
- 多段階データにおいてクラスタ効果が強い場合にランダム効果を組み込むことで得られる利点を示す。
提案手法
- 観測された混合タイプの変数を逆標準正規分布関数(CDF)を用いて標準正規スコアに変換する潜在変数モデルを用いる。
- 変数間の依存構造をモデル化するために、ガウス・コプシラ構造を用いた拡張ランク尤度(ホフ, 2007)を適用する。
- クラスタレベルでの相関を捉えるために、多変量正規分布を用いたランダム効果を組み込む。
- 名義尺度変数は、離散的かつ順序のないカテゴリを扱える潜在空間における多項プロビットモデルでモデル化する。
- パラメータと欠損値の後れ分布を近似するためにギブスサンプリングアルゴリズムを用いる。
- 複数の補完を用いて、欠損データに起因する不確実性を下流の解析に反映させる。
実験結果
リサーチクエスチョン
- RQ1コプシラベースの補完モデルは、多段階データにおける混合タイプの変数(連続、順序、名義)を効果的に処理できるか?
- RQ2クラスタリングが存在する状況でランダム効果を組み込むことで、補完精度がどのように向上するか?
- RQ3従来の補完手法(例:平均値補完、統合モデル)と比較して、本手法のパラメータ回復性能はどの程度か?
- RQ4正規分布からの逸脱がある場合でも、本モデルは良好な性能を維持するか?
- RQ5実世界の多段階臨床試験において、欠損データが存在する状況で、治療効果の回復はどの程度うまくいったか?
主な発見
- コプシラベースの補完モデルは、関心のあるモデルにおける補完精度が高く、真のパラメータの回復も効果的であった。
- 組内相関(ICC)が高くなる状況では、ランダム効果の組み込みが性能を顕著に向上させ、特にクラスタレベルの効果の回復に寄与した。
- 特に正規分布からの逸脱がある状況でも、従来の手法を上回る性能を示し、正規性からの逸脱に対して頑健であることが確認された。
- QASC試験の実データでは、混合変数タイプにわたり、最大17%までの欠損度合いに対しても、多段階構造を保持したまま適切に処理できた。
- 複数の補完を用いた結果、身体的および精神的健康スコアに対する治療効果の推定は安定的かつ精度が高く、p値と信頼区間が補完間で一貫していた。
- 適合度の観点から、ガウス・コプシラは計算的に便利であるが、一部の状況では尾部依存性を捉えるために代替コプシラ(例:tコプシラ)の使用が求められる可能性がある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。