[论文解读] Statistical Matching using Fractional Imputation
本文提出了一种基于工具变量假设的参数分数多重插补的新型统计匹配方法,避免了通常使用的条件独立性假设。通过利用插补的分数权重估计缺失变量的联合分布,该方法在数据融合和测量误差模型中实现了有效的推断,并提供了具有一致性的方差估计器。
Statistical matching is a technique for integrating two or more data sets when information available for matching records for individual participants across data sets is incomplete. Statistical matching can be viewed as a missing data problem where a researcher wants to perform a joint analysis of variables that are never jointly observed. A conditional independence assumption is often used to create imputed data for statistical matching. We consider an alternative approach to statistical matching without using the conditional independence assumption. We apply parametric fractional imputation of Kim (2011) to create imputed data using an instrumental variable assumption to identify the joint distribution. We also present variance estimators appropriate for the imputation procedure. We explain how the method applies directly to the analysis of data from split questionnaire designs and measurement error models.
研究动机与目标
- 解决传统统计匹配方法依赖于条件独立性假设所带来的局限性,该假设在实践中可能不现实。
- 开发一种基于工具变量假设的统计匹配方法,以识别缺失变量的联合分布。
- 为插补数据中的推断提供一致的方差估计器,确保有效的统计推断。
- 将该方法扩展至实际应用,如分问卷设计和测量误差模型。
- 通过实现从未在同一样本中共同观测到的变量的联合分析,提升调查研究中的数据整合能力。
提出的方法
- 应用参数分数多重插补(Kim, 2011)生成缺失变量的多个插补值,使用分数权重。
- 在不假设 $y_1 \perp y_2 \mid x$ 的前提下,利用工具变量 $x$ 和观测到的 $y_2$ 对样本B中的 $y_1$ 进行插补,基于可识别联合分布的模型。
- 使用估计方程与估计函数 $S_1(\theta_1)$ 和 $S_2(\theta_2)$ 来估计参数,其中 $\theta = (\theta_1, \theta_2)$。
- 通过基于得分的方法推导方差估计器,同时考虑插补和估计的变异性。
- 采用泰勒展开近似估计函数的分布,并推导方差-协方差矩阵。
- 在原假设 $H_0: \theta_2 = \theta_{2,0}$ 下构建基于估计函数方差的得分检验,使用基于估计方差的检验统计量。
实验结果
研究问题
- RQ1是否可以在不依赖条件独立性假设的情况下进行统计匹配?
- RQ2如何利用工具变量假设来识别统计匹配中缺失变量的联合分布?
- RQ3在基于分数多重插补的统计匹配中,应采用何种适当的方差估计器?
- RQ4所提出的方法在分问卷设计和测量误差模型中的表现如何?
- RQ5能否在插补数据框架中构建有效的得分检验来检验参数?
主要发现
- 所提出的方法通过使用工具变量识别 $y_1$ 和 $y_2$ 的联合分布,成功避免了具有限制性的条件独立性假设。
- 该方法提供了具有一致性的方差估计器,能够同时考虑插补和估计的不确定性,从而实现有效的推断。
- 模拟研究结果表明,该方法在偏差和置信区间覆盖方面表现良好,尤其在条件独立性假设被违反时表现更优。
- 基于估计方程的得分检验在有限样本中表现出适当的 I 类错误率和良好的检验效能。
- 该方法可直接应用于分问卷设计,其中不同变量在同一个人群的不同子样本中被收集。
- 该方法可自然地推广至测量误差模型,其目标是利用辅助信息校正协变量中的误差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。