[論文レビュー] Discrete Choice Models for Nonmonotone Nonignorable Missing Data: Identification and Inference
本稿では、離散選択モデル(DCM)を用いて非単調的かつ非無視的欠損データの因果推論のための新しい半パラメトリック枠組みを提案する。特にロジットDCMを活用することで、非パラメトリックな同定化を確立し、二重にロバストな、逆確率重量付き推定およびパターン混合推定器を開発する。これらの推定器は、一部のモデルが誤指定されている場合でも有効であり、社会・健康科学分野における複雑な欠損データパターンに対して柔軟かつ効率的な解決策を提供する。
Nonmonotone missing data arise routinely in empirical studies of social and health sciences, and when ignored, can induce selection bias and loss of efficiency. In practice, it is common to account for nonresponse under a missing-at-random assumption which although convenient, is rarely appropriate when nonresponse is nonmonotone. Likelihood and Bayesian missing data methodologies often require specification of a parametric model for the full data law, thus a priori ruling out any prospect for semiparametric inference. In this paper, we propose an all-purpose approach which delivers semiparametric inferences when missing data are nonmonotone and not at random. The approach is based on a discrete choice model (DCM) as a means to generate a large class of nonmonotone nonresponse mechanisms that are nonignorable. Sufficient conditions for nonparametric identification are given, and a general framework for fully parametric and semiparametric inference under an arbitrary DCM is proposed. Special consideration is given to the case of logit discrete choice nonresponse model (LDCM) for which we describe generalizations of inverse-probability weighting, pattern-mixture estimation, doubly robust estimation and multiply robust estimation.
研究の動機と目的
- 社会・健康科学分野の研究において、標準的なMAR仮定がしばしば妥当でない非単調的・非無視的欠損データの課題に対処すること。
- BCMAR や GPM といった既存手法の限界を克服すること。これらの手法は、変数自体の未観測値に依存する欠損の仕組みをモデル化できない。
- 任意の離散選択非応答モデルに基づく一般化された半パラメトリック推論枠組みを構築すること。これにより、完全データの分布を完全にパラメトリックにモデル化する必要なく、ロバストな推定が可能になる。
- 非単調的非無視的欠損データに対して、二重にロバストおよび多重にロバストな推定を拡張し、モデル誤指定に対する耐性を高めつつ効率性を向上させること。
- 最小限の仮定のもとで一貫した推定が可能な非パラメトリック同定化条件を提供すること。特にロジットDCMのケースにおいて有効である。
提案手法
- 未観測の変数値に依存する非無視的かつ非単調的な欠損データ機構を、広範なクラスとして生成できる柔軟なツールとして離散選択モデル(DCM)を用いる。
- 任意のDCMに対して非パラメトリック同定化の十分条件を確立し、観察されたデータから完全データの分布を回復可能であることを保証する。
- DCMフレームワーク下で、逆確率重量付き(IPW)、パターン混合モデル(PM)、および二重にロバスト(DR)推定器を統合した一般化された推定フレームワークを提案する。
- ロジットDCM(LDCM)のケースでは、明示的な推定方程式を導出し、同定化が完全ケースの欠損値(CCMV)制約に依存することを示す。これは、既存のパターン混合モデルと関連している。
- 二段階推定手順を実装する:まずDCM(例:欠損パターンのためのロジット回帰)を用いて非応答メカニズムを推定し、次にIPWまたはDR手法を用いて関心パラメータを推定する。
- 推定方程式および経験過程理論を用いて、正則性条件のもとで提案された推定器の漸近的正規性と一貫性を確立する。
実験結果
リサーチクエスチョン
- RQ1完全データ分布に対する強いパラメトリック仮定を回避しつつ、非単調的・非無視的欠損データに対して一般化された半パラメトリック枠組みを構築できるか?
- RQ2非応答が未観測値に依存する離散選択メカニズムを介して発生する場合、どのような条件下で完全データのパラメータが非パラメトリックに同定可能か?
- RQ3DCMフレームワーク下で、二重にロバストおよび多重にロバストな推定を非単調的非無視的欠損データに拡張できるか?
- RQ4有限標本において、標準的なIPWおよびPM推定器と比較して、提案手法はバイアス、分散、信頼区間のカバレッジにおいてどのように異なるか?
- RQ5ロジットDCMのケースにおいて、完全ケースの欠損値(CCMV)制約は同定化に十分か?また、既存のパターン混合モデルとどのように関係するか?
主な発見
- 提案手法は一般DCMのもとで非パラメトリック同定化を達成し、実証的に解釈可能な同定化条件を提供する。
- ロジットDCMのケースでは、未観測変数の条件付き分布が完全ケースと一致する場合に同定化が達成され、これはCCMV制約と同等である。
- シミュレーション結果から、二重にロバスト(DR)推定器は、非応答モデルまたはアウトカムモデルのいずれかが誤指定されていても、低いバイアスと良好なカバレッジを維持しており、RMSEの観点でIPWおよびPMを上回っている。
- 非応答モデルとアウトカムモデルが両方とも正しく指定された状況(bth*)では、DR推定器のRMSEは0.048にまで低下し、バランスの取れた状況下でIPW(0.072)およびPM(0.046)を大きく下回っている。
- モデル誤指定の状況(例:bad)では、DR推定器がIPW(0.748)およびPM(0.373)よりも優れた性能を示し、最悪ケースでもRMSEが0.385にとどまる。
- モデル誤指定に対して本手法はロバストであることが、シミュレーション全般にわたり、信頼区間のカバレッジ確率の安定性と低バイアスの両方で裏付けられている。特にDR推定器において顕著である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。