Skip to main content
QUICK REVIEW

[论文解读] Penalized pairwise pseudo likelihood for variable selection with nonignorable missing data

Jiwei Zhao, Yang Yang|arXiv (Cornell University)|Mar 19, 2017
Statistical Methods and Inference参考文献 42被引用 6
一句话总结

本文提出了一种惩罚配对伪似然方法,用于在存在非忽略缺失数据的高维广义线性模型中进行变量选择。通过利用未指定的、灵活的缺失数据机制,并聚焦于可估计的离散度缩放参数,该方法即使在完整参数无法识别的情况下,也能实现变量选择的一致性,对模型误设和非忽略缺失具有鲁棒性。

ABSTRACT

The regularization approach for variable selection was well developed for a completely observed data set in the past two decades. In the presence of missing values, this approach needs to be tailored to different missing data mechanisms. In this paper, we focus on a flexible and generally applicable missing data mechanism, which contains both ignorable and nonignorable missing data mechanism assumptions. We show how the regularization approach for variable selection can be adapted to the situation under this missing data mechanism. The computational and theoretical properties for variable selection consistency are established. The proposed method is further illustrated by comprehensive simulation studies and real data analyses, for both low and high dimensional settings.

研究动机与目标

  • 解决在缺失不是随机(MNAR)的数据下,高维广义线性模型中变量选择的挑战,此时标准似然方法会失效。
  • 克服参数化缺失数据机制假设的局限性,这些假设对误设敏感,且在MNAR情境下通常不适用。
  • 开发一种方法,在灵活且未指定的缺失数据机制下依然有效且一致,该机制包含可忽略和非忽略两种情形。
  • 在即使由于缺失数据导致完整参数估计不可识别的情况下,建立变量选择的理论和计算一致性。
  • 提供一种鲁棒且计算上可行的方法,避免强参数假设,同时在高维设置下保持选择一致性。

提出的方法

  • 基于条件似然原理,构建一个基于未指定、灵活缺失数据机制的配对伪似然函数,以处理缺失数据。
  • 聚焦于估计原始回归参数的离散度缩放版本,即使在完全识别失败时仍保持可估计性。
  • 对伪似然应用正则化(LASSO、SCAD或MCP),以实现变量选择,目标是真实参数向量中的稀疏性。
  • 使用迭代算法(如坐标下降或主要化-最小化)来优化惩罚伪似然,确保收敛至稀疏解。
  • 通过证明在正则性条件下,系数向量的估计支持与真实支持以高概率匹配,建立理论一致性。
  • 利用浓度不等式和限制特征值条件,推导收敛速率和选择一致性,即使在非凸惩罚下也成立。

实验结果

研究问题

  • RQ1当数据缺失不是随机(MNAR)且缺失机制未指定时,是否可以在高维广义线性模型中一致地执行变量选择?
  • RQ2如何构建一种伪似然方法,使其在非忽略缺失下依然有效且可估计,而无需对缺失机制假设参数模型?
  • RQ3在部分非可识别性存在的情况下,哪些理论条件可确保惩罚配对伪似然方法实现选择一致性?
  • RQ4与现有的基于似然或EM的方法相比,该方法在MNAR机制下的性能如何?
  • RQ5当真实参数向量为稀疏且预测变量数量随样本量增长时,该方法是否仍能保持选择一致性?

主要发现

  • 所提出的惩罚配对伪似然方法在包含非忽略情形的灵活、未指定的缺失数据机制下,实现了变量选择的一致性。
  • 即使在无法实现完整参数识别的情况下,该方法也能确保估计模型支持以高概率匹配真实模型支持。
  • 理论分析表明,在正则性条件下,估计量收敛至Oracle估计量,包括 $ s^* \sqrt{\log p / n} = o_p(1) $,从而确保一致性。
  • 参数估计量的收敛速率受 $ \| \widehat{\bm{\gamma}}^{(l)} - \bm{\gamma}^* \|_2 \leq c_{14} \rho_*^{-1} \sqrt{s^*} \lambda $ 限制,支持向真实参数的收敛速率。
  • 由于缺失数据机制假设的非参数性质,该方法对模型误设具有鲁棒性,避免了错误参数建模带来的偏差。
  • 模拟和真实数据的数值结果证实,该方法在非忽略缺失下能够正确识别相关变量,在MNAR情景中优于基于MAR的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。