Skip to main content
QUICK REVIEW

[论文解读] Individualized Multi-directional Variable Selection

Xiwei Tang, Xue, Fei|arXiv (Cornell University)|Sep 15, 2017
Statistical Methods and Inference参考文献 44被引用 7
一句话总结

本文提出了一种新颖的个性化多方向变量选择方法,可同时实现个体特异性特征选择与具有相似协变量效应的个体分组。通过引入多方向收缩惩罚,该方法在识别每个个体独特相关预测变量的同时,从子组中借用信息,从而在纵向和异质性数据设置下提升了预测准确性和估计效率。

ABSTRACT

In this paper we propose a heterogeneous modeling framework which achieves individual-wise feature selection and individualized covariates' effects subgrouping simultaneously. In contrast to conventional model selection approaches, the new approach constructs a separation penalty with multi-directional shrinkages, which facilitates individualized modeling to distinguish strong signals from noisy ones and selects different relevant variables for different individuals. Meanwhile, the proposed model identifies subgroups among which individuals share similar covariates' effects, and thus improves individualized estimation efficiency and feature selection accuracy. Moreover, the proposed model also incorporates within-individual correlation for longitudinal data to gain extra efficiency. We provide a general theoretical foundation under a double-divergence modeling framework where the number of individuals and the number of individual-wise measurements can both diverge, which enables inference on both an individual level and a population level. In particular, we establish strong oracle property for the individualized estimator to ensure its optimal large sample property under various conditions. An efficient ADMM algorithm is developed for computational scalability. Simulation studies and applications to post-trauma mental disorder analysis with genetic variation and an HIV longitudinal treatment study are illustrated to compare the new approach to existing methods.

研究动机与目标

  • 解决传统群体水平模型无法捕捉个体特异性预测变量相关性及异质性治疗效应的局限性。
  • 开发一种可同时实现个体层面变量选择并识别具有相似协变量效应子组的方法,以提升估计效率与准确性。
  • 在纵向数据中纳入个体内部相关性,以超越独立误差假设,提升模型效率。
  • 在个体数量与个体水平测量数均发散的双重发散框架下,建立理论基础。
  • 实现个体化估计量的强Oracle性质,确保在各种正则性条件下具备最优的大样本性能。

提出的方法

  • 提出多方向分离惩罚,允许向多个方向收缩——不仅限于零——从而灵活识别强信号与噪声。
  • 采用双重发散渐近框架,其中个体数量与个体层面测量数均发散,支持个体与群体水平的推断。
  • 在纵向数据中纳入个体内部序列相关性,以超越独立同分布假设,提升估计效率。
  • 采用ADMM算法实现高效计算,支持大规模数据集的可扩展性。
  • 通过基于共享回归系数模式的聚类识别子组,利用惩罚结构促进组内同质性。
  • 在统一模型中整合个体化与群体共享预测变量,未来可扩展至高维设置。

实验结果

研究问题

  • RQ1是否存在单一统计框架,可同时基于异质性协变量效应实现个体特异性变量选择与子组识别?
  • RQ2与仅向零收缩的常规凸惩罚相比,多方向收缩如何提升估计准确性并降低偏差?
  • RQ3在个体水平样本大小发散的双重发散框架下,个体化估计量的大样本行为如何?
  • RQ4在纵向数据中纳入个体内部相关性,如何影响估计效率与模型性能?
  • RQ5在真实世界生物医学数据中,该方法在个性化预测与子组检测方面相较于现有方法的优越程度如何?

主要发现

  • 在PTSD遗传研究中,MDSP模型相比混合模型预测RMSE降低15%,相比同质模型降低32%。
  • MDSP模型成功识别出三个CpG位点(cg03256465、cg03762702、cg06473843)在不同子组中具有显著非零效应,各子组占样本比例为34.2%至40.4%。
  • 相比之下,混合模型仅在一个子组中识别出一个显著CpG位点(cg0647384),表明其子组划分信息量较低。
  • 所提方法实现了强Oracle性质,证实当已知真实子群信息时,估计量具备最优收敛速率。
  • 在HIV纵向研究中,该方法在检测异质性治疗效应方面表现更优,模型拟合度更高且子组更具可解释性。
  • 理论结果确立了个体化参数维度随样本量增加的最优发散速率,支持在高维设置下的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。