Skip to main content
QUICK REVIEW

[论文解读] Predictive Correlation Screening: Application to Two-stage Predictor Design in High Dimension

Hamed Firouzi, Bala Rajaratnam|arXiv (Cornell University)|Mar 10, 2013
Gene expression and cancer classification参考文献 17被引用 14
一句话总结

本文提出预测相关性筛选(PCS),一种可扩展的、假阳性受控的变量选择方法,适用于两阶段预测器设计中的高维线性回归。通过利用预测变量与响应变量之间的双分图相关性结构,PCS在第一阶段以低计算成本筛选出信息丰富的变量,并在小样本量和高 p ≫ n 设置下,相比 LASSO 和相关性学习方法,实现了更优的预测精度和更低的均方误差(MSE)。

ABSTRACT

We introduce a new approach to variable selection, called Predictive Correlation Screening, for predictor design. Predictive Correlation Screening (PCS) implements false positive control on the selected variables, is well suited to small sample sizes, and is scalable to high dimensions. We establish asymptotic bounds for Familywise Error Rate (FWER), and resultant mean square error of a linear predictor on the selected variables. We apply Predictive Correlation Screening to the following two-stage predictor design problem. An experimenter wants to learn a multivariate predictor of gene expressions based on successive biological samples assayed on mRNA arrays. She assays the whole genome on a few samples and from these assays she selects a small number of variables using Predictive Correlation Screening. To reduce assay cost, she subsequently assays only the selected variables on the remaining samples, to learn the predictor coefficients. We show superiority of Predictive Correlation Screening relative to LASSO and correlation learning (sometimes popularly referred to in the literature as marginal regression or simple thresholding) in terms of performance and computational complexity.

研究动机与目标

  • 解决高维、欠定线性回归问题(p ≫ n),其中传统方法如 LASSO 存在计算成本过高的问题。
  • 开发一种可扩展的变量选择方法,在保持小样本、高维设置下高预测精度的同时,控制假发现率。
  • 设计一种两阶段预测器框架,通过先在少量高通量样本上筛选变量,再在额外的低成本低通量样本上估计系数,从而降低检测成本。
  • 为所选预测器建立家族错误发现率(FWER)和均方误差(MSE)的理论边界。
  • 在合成数据和真实生物数据(基因表达和症状评分)中,证明 PCS 相较于 LASSO 和相关性学习方法的优越性。

提出的方法

  • 构建预测变量 X_j 与响应变量 Y_k 之间的双分图,若截断的最小范数回归系数 a_jk 非零,则存在一条边。
  • 使用伪逆相关矩阵以纳入预测变量之间的相关性,从而在选择精度上优于简单的相关性阈值方法。
  • 对最小范数回归系数应用阈值规则以筛选变量,并通过泊松类似极限定理实现假阳性控制。
  • 实施两阶段设计:第一阶段,利用 PCS 在少量高成本样本上选择少量变量;第二阶段,仅在额外的、成本更低的样本上使用所选变量估计完整预测器。
  • 根据响应类型(连续或离散)在第二阶段使用 OLS 或多项式逻辑回归。
  • 借助蒙特卡洛模拟和理论分析,推导 FWER 和 MSE 的渐近边界,表明误差概率随样本量增加呈指数衰减。

实验结果

研究问题

  • RQ1能否开发一种可扩展的变量选择方法,在高维、小样本设置(p ≫ n)下以低计算成本控制假发现率?
  • RQ2在预测精度和计算复杂度方面,预测相关性筛选(PCS)相较于 LASSO 和相关性学习方法表现如何?
  • RQ3第一阶段样本数 n 与正确恢复最优 OLS 预测器真实支撑集概率之间的理论关系是什么?
  • RQ4当每样本成本随检测变量数量线性增长时,两阶段 PCS 框架是否能实现接近“理想”性能的 MSE?
  • RQ5PCS 中假发现概率的相变阈值是多少?在小 n 和大 p 条件下其行为如何?

主要发现

  • PCS 实现了假发现数量的泊松类似极限,使得即使在小样本量和大 p 情况下,也能对 FWER 进行精确近似。
  • 理论分析表明,当第一阶段样本数 n = O(log p) 时,PCS 以高概率恢复最优 OLS 预测器的真实支撑集。
  • 在 p = 10^4 且 q = 1 的模拟中,PCS 的均方误差(MSE)低于 LASSO 和相关性学习方法,接近理想 OLS 预测器的性能。
  • 在真实基因表达数据(38 名受试者)中,PCS 将平均 MSE 降低了 13%(0.3036 vs. 0.3482),尤其在咳嗽和呼吸困难等症状上改善显著。
  • 蒙特卡洛模拟结果证实,随着第一阶段样本量 n 增加,FWER 至少呈指数下降,验证了理论边界的正确性。
  • 当每样本成本与检测变量数量线性相关时,最优第一阶段样本数 n 的数量级为 log p,表明该两阶段设计具有成本效益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。