Skip to main content
QUICK REVIEW

[论文解读] A note on marginal correlation based screening

Somak Dutta, Vivekananda Roy|arXiv (Cornell University)|Jul 25, 2017
Gene expression and cancer classification参考文献 15被引用 3
一句话总结

本文批判了超高维数据中基于边际相关性的筛选方法,通过模拟数据和真实基因组数据表明,当预测变量相关或重要变量与噪声不相关时,该方法可能失效。研究显示,在此类情境下,其他筛选方法表现更优,凸显了在高维统计中改进变量选择技术的必要性。

ABSTRACT

Independence screening methods such as the two sample $t$-test and the marginal correlation based ranking are among the most widely used techniques for variable selection in ultrahigh dimensional data sets. In this short note, simple examples are used to demonstrate potential problems with the independence screening methods in the presence of correlated predictors. Also, an example is considered where all important variables are independent among themselves and all but one important variables are independent with the unimportant variables. Furthermore, a real data example from a genome wide association study is used to illustrate inferior performance of marginal correlation screening compared to another screening method.

研究动机与目标

  • 探究在预测变量相关的情况下,基于边际相关性的筛选方法的可靠性。
  • 评估即使重要变量与噪声不相关,基于边际相关性的筛选方法是否仍可能遗漏关键变量。
  • 利用全基因组关联研究(GWAS)的真实数据,比较基于边际相关性的筛选方法与其他筛选方法的性能。
  • 证明尽管具有理论吸引力,基于边际相关性的独立筛选方法在实际高维场景中可能失效。

提出的方法

  • 作者构建了具有相关预测变量的模拟示例,以说明基于边际相关性的筛选方法可能错误地对重要变量进行排序或将其遗漏。
  • 设计了一种情境,其中所有重要变量相互独立,且与非重要变量大多不相关,但基于边际相关性的筛选方法仍无法检测到这些变量。
  • 使用来自全基因组关联研究(GWAS)的真实数据,对基于边际相关性的筛选方法与另一种筛选方法进行实证比较。
  • 比较重点在于变量选择的准确性,特别是在高维性和相关性结构并存的环境下识别真正重要预测变量的能力。

实验结果

研究问题

  • RQ1当预测变量相关时,基于边际相关性的筛选方法是否可能无法识别重要变量?
  • RQ2当重要变量与非重要变量不相关时,基于边际相关性的筛选方法是否表现欠佳?
  • RQ3在真实高维基因组数据中,基于边际相关性的筛选方法与替代方法相比表现如何?
  • RQ4在何种条件下,基于边际相关性的独立筛选方法在实际中会失效?

主要发现

  • 当预测变量相关时,即使这些变量与响应变量真正相关,基于边际相关性的筛选方法仍可能遗漏重要变量。
  • 在重要变量与非重要变量不相关的情境下,基于边际相关性的筛选方法仍表现欠佳,原因在于相关性引起的偏差。
  • 真实GWAS数据示例表明,另一种筛选方法在识别相关遗传标记方面优于基于边际相关性的方法。
  • 研究结论认为,尽管基于边际相关性的筛选方法简单且广受欢迎,但在具有复杂相关性结构的实际场景中并不可靠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。