[论文解读] Nonparametric inference about mean functionals of nonignorable nonresponse data without identifying the joint distribution
本文提出了一种非参数方法,通过使用一个影子变量,在不可忽略缺失数据的情况下估计均值泛函,避免了对完整联合分布的识别。该方法基于求解一个表示方程的Sieve估计量,建立了识别性和渐近正态性,且在常规条件下实现了半参数效率。
We consider identification and inference about mean functionals of observed covariates and an outcome variable subject to nonignorable missingness. By leveraging a shadow variable, we establish a necessary and sufficient condition for identification of the mean functional even if the full data distribution is not identified. We further characterize a necessary condition for $\sqrt{n}$-estimability of the mean functional. This condition naturally strengthens the identifying condition, and it requires the existence of a function as a solution to a representer equation that connects the shadow variable to the mean functional. Solutions to the representer equation may not be unique, which presents substantial challenges for nonparametric estimation and standard theories for nonparametric sieve estimators are not applicable here. We construct a consistent estimator for the solution set and then adapt the theory of extremum estimators to find from the estimated set a consistent estimator for an appropriately chosen solution. The estimator is asymptotically normal, locally efficient and attains the semiparametric efficiency bound under certain regularity conditions. We illustrate the proposed approach via simulations and a real data application on home pricing.
研究动机与目标
- 解决结果数据缺失非随机(MNAR)时估计均值泛函的挑战,标准方法因选择偏差而失效。
- 通过利用一个影子变量克服MNAR设定下的识别困难——该影子变量完全可观测,与结果相关,但在给定协变量和结果的条件下与缺失性无关。
- 开发一种无需对缺失机制或结果回归施加参数假设的模型无关估计框架。
- 建立均值泛函$√n$-可估计的条件,以及所提估计量的一致性和渐近正态性。
- 通过构建表示方程解集的一致估计量并选择合适解,实现半参数效率。
提出的方法
- 利用影子变量诱导出即使在完整数据分布未被识别的情况下,均值泛函识别的必要且充分条件。
- 构建一个表示方程——一种第一类弗雷德霍姆积分方程——将影子变量与均值泛函联系起来,作为核心识别工具。
- 构造一个基于Sieve的估计量,以一致地估计表示方程的解集,解决解不唯一的问题。
- 将极值估计理论进行适配,从估计的解集中选择一个一致的解,从而实现对均值泛函的推断。
- 在常规条件下(包括条件密度的完备性和可积性假设)建立渐近正态性和半参数效率。
- 通过条件数学期望算子的奇异值分解刻画表示方程解的存在性。
实验结果
研究问题
- RQ1在未识别完整联合分布的情况下,何时可以非参数地识别具有不可忽略缺失性的结果的均值泛函?
- RQ2在存在不可忽略缺失性的情况下,均值泛函$√n$-可估计性的必要且充分条件是什么?
- RQ3当表示方程的解不唯一时,如何一致地估计其解集?如何从该解集中构造一个均值泛函的一致估计量?
- RQ4在表示方程的解唯一的某个关键子模型中,所提估计量是否能达到半参数效率下界?
- RQ5确保表示方程解存在的正则条件是什么?它们与条件数学期望算子的完备性有何关联?
主要发现
- 即使完整数据分布未被识别,均值泛函在涉及影子变量的必要且充分条件下仍可实现非参数识别。
- $√n$-可估计性的必要条件是表示方程(一种第一类弗雷德霍姆积分方程)存在解。
- 所提出的基于Sieve的估计量即使在表示方程的解不唯一的情况下,对均值泛函仍是一致的。
- 在常规条件下,估计量渐近正态并达到半参数效率下界,尤其在表示方程解唯一的子模型中表现优异。
- 在完备性条件及条件密度的可积性假设下,表示方程的解存在,该结论通过奇异值分解形式化表达。
- 该方法为标准测量误差模型提供了一种稳健替代方案,避免了强识别假设,转而依赖于最小且在经验上合理的影子变量假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。