[论文解读] Discrete Choice Models for Nonmonotone Nonignorable Missing Data: Identification and Inference
本文提出了一种新颖的半参数框架,用于在非单调、非忽略缺失数据条件下进行因果推断,利用离散选择模型(DCM)建模非响应机制。通过利用DCM(特别是Logit DCM),该方法实现了非参数识别,并提出了双重稳健、逆概率加权及模式混合估计器,即使在部分模型设定错误时仍保持有效性,为社会科学与健康科学中复杂缺失数据模式提供了一种灵活且高效的解决方案。
Nonmonotone missing data arise routinely in empirical studies of social and health sciences, and when ignored, can induce selection bias and loss of efficiency. In practice, it is common to account for nonresponse under a missing-at-random assumption which although convenient, is rarely appropriate when nonresponse is nonmonotone. Likelihood and Bayesian missing data methodologies often require specification of a parametric model for the full data law, thus a priori ruling out any prospect for semiparametric inference. In this paper, we propose an all-purpose approach which delivers semiparametric inferences when missing data are nonmonotone and not at random. The approach is based on a discrete choice model (DCM) as a means to generate a large class of nonmonotone nonresponse mechanisms that are nonignorable. Sufficient conditions for nonparametric identification are given, and a general framework for fully parametric and semiparametric inference under an arbitrary DCM is proposed. Special consideration is given to the case of logit discrete choice nonresponse model (LDCM) for which we describe generalizations of inverse-probability weighting, pattern-mixture estimation, doubly robust estimation and multiply robust estimation.
研究动机与目标
- 解决社会与健康科学研究中非单调、非忽略缺失数据的挑战,其中标准MAR假设往往不可靠。
- 克服现有方法(如BCMAR与GPM)的局限性,这些方法无法建模缺失性依赖于变量自身未观测值的情况。
- 在任意离散选择非响应模型下,构建一个通用的半参数推断框架,实现在无需完整参数化完整数据分布的情况下稳健估计。
- 将双重稳健与多重稳健估计扩展至非单调、非忽略缺失数据,提升对模型设定错误的稳健性与效率。
- 提供非参数识别条件,使在最小假设下实现一致估计成为可能,尤其在Logit DCM情形下。
提出的方法
- 使用离散选择模型(DCM)作为灵活工具,生成一类非忽略、非单调缺失数据机制,其中缺失性依赖于变量的未观测值。
- 在任意DCM下建立非参数识别的充分条件,确保可从观测数据中恢复完整数据分布。
- 提出一个通用估计框架,结合逆概率加权(IPW)、模式混合建模(PM)与双重稳健(DR)估计器,适用于DCM框架。
- 对于Logit DCM(LDCM),推导显式估计方程,并表明识别依赖于完整案例缺失值(CCMV)限制,与现有模式混合模型相联系。
- 实施两阶段估计程序:首先通过DCM(如缺失模式的Logit模型)估计非响应机制;随后使用IPW或DR方法估计感兴趣参数。
- 利用估计方程与经验过程理论,在正则条件下建立所提估计器的渐近正态性与一致性。
实验结果
研究问题
- RQ1能否为非单调、非忽略缺失数据开发一个通用的半参数框架,避免对完整数据分布施加强参数假设?
- RQ2当缺失性通过离散选择机制依赖于未观测值时,在何种条件下完整数据参数可实现非参数识别?
- RQ3在DCM框架下,能否将双重稳健与多重稳健估计扩展至非单调、非忽略缺失数据?
- RQ4在有限样本中,所提方法与标准IPW与PM估计器相比,在偏差、方差与置信区间覆盖方面表现如何?
- RQ5在Logit DCM情形下,完整案例缺失值(CCMV)限制是否足以实现识别?其与现有模式混合模型的关系如何?
主要发现
- 所提方法在一般DCM下实现非参数识别,识别条件具有可解释性且基于可观测数据。
- 在Logit DCM情形下,若给定观测变量的未观测变量条件分布与完整案例中一致,则可实现识别——该条件等价于CCMV限制。
- 模拟结果表明,双重稳健(DR)估计器即使在非响应模型或结果模型任一设定错误时,仍保持低偏差与良好覆盖,其均方根误差优于IPW与PM。
- 当非响应模型与结果模型均正确设定(bth*)时,DR估计器的均方根误差为0.048,显著低于IPW(0.072)与PM(0.046)在平衡情景下的表现。
- 在模型设定错误的情景下(如bad),DR估计器表现优于IPW与PM,最坏情形下RMSE为0.385,而IPW为0.748,PM为0.373。
- 该方法对模型设定错误具有稳健性,表现为所有模拟设定下覆盖概率稳定、偏差低,尤其在DR估计器下表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。