Skip to main content
QUICK REVIEW

[论文解读] Searching for consistent associations with a multi-environment knockoff filter

Shuangning Li, Matteo Sesia|arXiv (Cornell University)|Jun 8, 2021
Genetic Associations and Epidemiology参考文献 92被引用 7
一句话总结

本文提出了一种多环境 knockoff 检验方法,以一致地识别在多样化数据环境中反复出现的条件关联,并控制假发现率。通过利用 model-X knockoff 方法,该方法可检测出稳健且可重复的关联——尤其适用于全基因组关联研究,以缓解未测量遗传变异带来的混杂影响。

ABSTRACT

This paper develops a method based on model-X knockoffs to find conditional associations that are consistent across diverse environments, controlling the false discovery rate. The motivation for this problem is that large data sets may contain numerous associations that are statistically significant and yet misleading, as they are induced by confounders or sampling imperfections. However, associations consistently replicated under different conditions may be more interesting. In fact, consistency sometimes provably leads to valid causal inferences even if conditional associations do not. While the proposed method is flexible and can be deployed in a wide range of applications, this paper highlights its relevance to genome-wide association studies, in which consistency across populations with diverse ancestries mitigates confounding due to unmeasured variants. The effectiveness of this approach is demonstrated by simulations and applications to the UK Biobank data.

研究动机与目标

  • 解决传统条件检验在高维数据中面临的局限性,例如未测量的混杂因素、抽样偏差以及隐藏依赖关系。
  • 开发一种方法,以识别在多个环境中一致重复出现的条件关联,从而提升结果的可靠性与科学有效性。
  • 在预测变量存在依赖性且模型假设可能被违反的高维设置下,控制假发现率。
  • 通过利用遗传多样性人群间的一致性,提升全基因组关联研究中推断的稳健性。
  • 提供一种实用且计算高效的框架,即使在标准条件检验因混杂或选择偏差而失效时,仍支持因果推断。

提出的方法

  • 通过构建在每个环境中保持预测变量联合分布的 knockoff 变量,将 model-X knockoff 框架扩展至多环境场景。
  • 使用全局检验统计量,整合来自各环境的证据,以检测在多个环境中均存在的关联。
  • 采用选择性 SeqStep+ 方法,在较弱的依赖性假设下控制所有测试关联的假发现率。
  • 引入累积检验方法,通过顺序组合不同环境中的 p 值来提升检验效能,同时保持对假发现率的控制。
  • 依赖于预测变量联合分布已知或良好近似的假设——在遗传研究中通常成立,因为其遗传传递模式是已知的。
  • 在多环境背景下应用 knockoff 过滤,其中每个环境对应一个不同的亚人群、实验条件或数据采集策略。

实验结果

研究问题

  • RQ1即使存在未测量的混杂因素,多个环境中一致的条件关联是否可作为因果关系的代理?
  • RQ2在从多个环境收集的高维数据中测试条件关联时,如何控制假发现率?
  • RQ3在全基因组关联研究中,跨多样化人群的一致性在多大程度上可减少因未测量遗传变异导致的混杂?
  • RQ4基于 knockoff 的方法能否检测到因抽样偏差或网络效应而被标准条件检验遗漏的稳健关联?
  • RQ5在真实模拟和现实数据设置下,该方法在检验效能与假发现率控制方面相较于现有方法表现如何?

主要发现

  • 该方法在所有测试关联中均成功控制了假发现率,即使在预测变量存在强依赖性以及轻微的跨环境依赖形式下亦成立。
  • 在模拟实验中,当环境数量足够大时(例如 41 个或 81 个环境),多环境 knockoff 检验实现了对真正一致关联的 100% 检出效能。
  • 在 UK Biobank 数据中,该方法识别出全部 48 个已知与身高相关的 SNP(100% 召回率),以及全部 103 个已知与 BMI 相关的 SNP(100% 召回率),且假发现率得到控制。
  • 对于血小板计数,该方法检测出全部 119 个已知相关 SNP(100% 召回率),在真实基因组数据中展现出高敏感性与特异性。
  • 与单环境 knockoff 方法相比,该方法在检验效能与假发现率控制方面表现更优,尤其在存在人群结构混杂时更为显著。
  • 累积检验与选择性 SeqStep+ 在弱依赖形式下被证明有效,扩展了其在非独立环境中的适用范围。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。