[論文レビュー] JointAI: Joint Analysis and Imputation of Incomplete Data in R
JointAI は、完全に整合性のある統合モデリングフレームワークを用いて、欠損データに対する共同ベイズ解析と多重代入を可能にする R パッケージである。標準的な代入法が抱える不整合性(uncongeniality)の問題を、結果と共変数を同時にモデリングすることによって克服し、非線形効果、交互作用、生存分析、多層構造データを含む複雑なモデルに対しても一貫した推論を可能にする。
Missing data occur in many types of studies and typically complicate the analysis. Multiple imputation, either using joint modelling or the more flexible fully conditional specification approach, are popular and work well in standard settings. In settings involving non-linear associations or interactions, however, incompatibility of the imputation model with the analysis model is an issue often resulting in bias. Similarly, complex outcomes such as longitudinal or survival outcomes cannot be adequately handled by standard implementations. In this paper, we introduce the R package JointAI, which utilizes the Bayesian framework to perform simultaneous analysis and imputation in regression models with incomplete covariates. Using a fully Bayesian joint modelling approach it overcomes the issue of uncongeniality while retaining the attractive flexibility of fully conditional specification multiple imputation by specifying the joint distribution of analysis and imputation models as a sequence of univariate models that can be adapted to the type of variable. JointAI provides functions for Bayesian inference with generalized linear and generalized linear mixed models and extensions thereof as well as survival models and joint models for longitudinal and survival data, that take arguments analogous to corresponding well known functions for the analysis of complete data from base R and other packages. Usage and features of JointAI are described and illustrated using various examples and the theoretical background is outlined.
研究の動機と目的
- 非線形効果や交互作用を含む複雑なモデルにおいて、代入モデルと分析モデルの不整合性(uncongeniality)が生じる問題に対処すること。
- 縦断的データ、生存分析、多層構造データなどの複雑な結果モデルにおける欠損共変数を統一的に扱うフレームワークを提供すること。
- 線形性を仮定する標準的な多重代入法(例:FCS や多変量正規分布を仮定する統合モデリング)の限界を克服し、非線形関連性や複雑な結果に対して効果的に対処できること。
- 代入と分析を一つの統合モデルに統合することで、ベイズ的手法を用いて一貫した推論を実現し、代入モデルと分析モデルの整合性を保証すること。
- R でのユーザーフレンドリーな実装を実現し、欠損データを含む回帰モデルに対して、ベース R や lme4 スタイルの構文を模倣すること。
提案手法
- すべての変数(結果変数と共変数)の同時分布を、一連の単変量条件付きモデルとして定式化する完全なベイズ統合モデリングアプローチを用いる。
- 統合モデルから導出されたフル条件付き分布からのサンプリングにより、欠損値を代入し、分析モデルと整合性を保つ。
- ガウス分布、二項分布、ポisson分布、ワイブル分布、コックス比例ハザードモデル、および縦断的・生存データの統合モデルを含む、さまざまな結果タイプをサポートする。
- スプライン、多項式、変換(例:log、exp)を用いて非線形効果を扱い、変換された変数を直接統合モデルに組み込む。
- 'models' 引数を用いて、正規分布、対数正規分布、ガンマ分布など、さまざまな分布を指定可能にし、柔軟な代入モデルの指定を可能にする。
- 'trunc' 引数を用いて、分布の切り捨て(例:log 変換された変数のため)を可能にし、数学的制約(例:log(x) は x > 0 の場合にのみ定義可能)を尊重する。

実験結果
リサーチクエスチョン
- RQ1ベイズフレームワークにおける統合モデリングは、非線形効果や交互作用が存在する状況で、代入モデルと分析モデルの整合性をどのように向上させるか?
- RQ2生存や縦断的データのような複雑な結果を持つ状況において、JointAI は MICE や多変量正規性を仮定する統合モデリングといった標準的な多重代入法をどの程度上回るか?
- RQ3分析モデルに変換、スプライン、交互作用が含まれる場合、JointAI は共変数の欠損データを偏りなく効果的に処理できるか?
- RQ4観測変数の関数(例:二次項)といった補助変数を用いることで、複雑なモデルにおける代入の正確性はどの程度向上するか?
- RQ5NHANES データのような高次元または非正規分布を示す共変数を含む実世界のデータセットにおいて、JointAI のパフォーマンスはいかがなものか?
主な発見
- JointAI は、非線形効果、交互作用、多層構造を含む複雑なモデルにおける欠損データを、モデルの不整合性を要請せずに効果的に処理できる。
- 線形モデル、一般化線形モデル、混合効果モデル、生存モデル、縦断的・生存データの統合モデルを含む幅広いモデルを、一貫したインターフェースでサポートする。
- 変数のタイプと制約(例:log 変換された変数のための分布の切り捨て)に応じて、自動的に代入モデルが適応される。
- 補助変数(例:I(WC^2) のような二次項)の使用により、代入プロセスに関連する情報を組み込むことで、代入の正確性が向上する。
- ilogit のような関数を R で定義することで、JAGS の構文に合わせた非標準的な変換をシームレスに使用可能にする。
- 分析モデルで変数の関数(例:log(uricacid))が使用されている場合、主効果(例:uricacid)が自動的に代入モデルの予測子として含まれるため、モデルの整合性が保たれる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。