Skip to main content
QUICK REVIEW

[论文解读] Knockoffs with Side Information

Zhimei Ren, Emmanuel J. Candès|arXiv (Cornell University)|Jan 22, 2020
Statistical Methods in Clinical Trials参考文献 43被引用 7
一句话总结

本文提出带有辅助信息的自适应 knockoff 方法,通过利用外部知识(如来自相关研究的先前 p 值)来增强高维数据中的变量选择能力,从而在严格控制错误发现率(FDR)的同时提升发现能力。该方法将 knockoff 框架扩展至基于外部证据(如先前研究的 p 值)自适应地优先选择特征,其在遗传关联研究中表现优异,包括对 HDL 和 LDL 特征分别平均发现 12.5 和 18.3 个位点,优于以往方法。

ABSTRACT

We consider the problem of assessing the importance of multiple variables or factors from a dataset when side information is available. In principle, using side information can allow the statistician to pay attention to variables with a greater potential, which in turn, may lead to more discoveries. We introduce an adaptive knockoff filter, which generalizes the knockoff procedure (Barber and Candès, 2015; Candès et al., 2018) in that it uses both the data at hand and side information to adaptively order the variables under study and focus on those that are most promising. Adaptive knockoffs controls the finite-sample false discovery rate (FDR) and we demonstrate its power by comparing it with other structured multiple testing methods. We also apply our methodology to real genetic data in order to find associations between genetic variants and various phenotypes such as Crohn's disease and lipid levels. Here, adaptive knockoffs makes more discoveries than reported in previous studies on the same datasets.

研究动机与目标

  • 开发一种在不损害 FDR 控制的前提下,通过整合辅助信息来提高多重检验统计功效的方法。
  • 将 knockoff 筛选框架扩展至允许基于外部证据(如先前研究的 p 值)对变量进行自适应加权。
  • 通过利用来自相关人群的辅助信息聚焦于生物学上有希望的变异,从而在全基因组关联研究(GWAS)中实现更多发现。
  • 即使 p 值存在误标定或模型假设被违反,也能在有限样本下保持 FDR 控制。

提出的方法

  • 该方法基于协变量与辅助信息的联合分布,构建尊重数据依赖性协方差结构的 knockoff 变量。
  • 根据先前研究的外部 p 值对特征进行排序,利用这些排序作为辅助信息以引导选择过程。
  • 采用贝叶斯两组模型估计局部 FDR,从而实现特征统计量的自适应阈值化。
  • 通过原始变量与 knockoff 变量的 Lasso 系数绝对值之差来衡量特征重要性:$ W_j = |\hat{\beta}_j| - |\hat{\tilde{\beta}}_j| $。
  • 每组数据集生成 50 个 knockoff 实现以确保稳定性,并报告在 $ q = 0.1 $ 水平下控制 FDR 的平均发现数量。
  • 初始化阶段使用阈值规则以揭示重要性较低的特征,从而提高效率并减少噪声。

实验结果

研究问题

  • RQ1能否利用先前研究的辅助信息在不增加错误发现率的前提下提升多重检验的统计功效?
  • RQ2如何将 knockoff 方法推广以整合外部知识(如相关人群的 p 值)?
  • RQ3使用辅助信息对特征进行自适应加权是否能相比标准 knockoff 或边际检验在 GWAS 中带来更多的发现?
  • RQ4当 p 值未被精确校准时,该方法是否仍能保持有限样本下的 FDR 控制?

主要发现

  • 在 NFBC 数据集中,自适应 knockoff 方法对 HDL 和 LDL 特征平均分别发现 12.5 和 18.3 个 SNP,显著优于 HMM knockoff(8 和 9.8 个发现)以及 Sabatti 等人(5 和 6 个发现)。
  • 该方法在保持 FDR 严格控制在目标水平 0.1 的同时,功效高于现有的基于 knockoff 的方法和边际检验方法。
  • 利用辅助信息(特别是其他人群的 p 值)使研究能够识别出此前未被发现的克罗恩病和脂质特征的关联。
  • 无论用于辅助信息的 p 值是否准确,FDR 控制均得以保持,表明该方法对模型误设具有鲁棒性。
  • 该算法在 50 次 knockoff 实现中表现出稳定性,发现率一致,结果变异极低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。