Skip to main content
QUICK REVIEW

[论文解读] Communication-Efficient False Discovery Rate Control via Knockoff Aggregation

Weijie Su, Junyang Qian|arXiv (Cornell University)|Jun 17, 2015
Wireless Communication Security Techniques被引用 5
一句话总结

本文提出了一种名为 knockoff aggregation 的通信高效方法,用于在去中心化线性模型的元分析中实现精确的错误发现率(FDR)控制。通过在每个组独立应用 knockoff 筛选,通过单次通信聚合汇总统计量,并采用一种新颖的聚合方案,该方法在无需噪声方差知识或稀疏性假设的前提下,实现了非渐近 FDR 控制,且通信复杂度在对数因子范围内达到最优。

ABSTRACT

The false discovery rate (FDR)---the expected fraction of spurious discoveries among all the discoveries---provides a popular statistical assessment of the reproducibility of scientific studies in various disciplines. In this work, we introduce a new method for controlling the FDR in meta-analysis of many decentralized linear models. Our method targets the scenario where many research groups---possibly the number of which is random---are independently testing a common set of hypotheses and then sending summary statistics to a coordinating center in an online manner. Built on the knockoffs framework introduced by Barber and Candes (2015), our procedure starts by applying the knockoff filter to each linear model and then aggregates the summary statistics via one-shot communication in a novel way. This method gives exact FDR control non-asymptotically without any knowledge of the noise variances or making any assumption about sparsity of the signal. In certain settings, it has a communication complexity that is optimal up to a logarithmic factor.

研究动机与目标

  • 为解决在因隐私或通信限制而无法共享数据的去中心化线性模型元分析中控制错误发现率(FDR)的挑战。
  • 开发一种方法,在多个独立研究的非渐近设置下,保持高统计功效的同时确保精确的 FDR 控制。
  • 最小化研究组与中心协调者之间的通信成本,实现可扩展且实用的大规模假设检验。
  • 将 knockoff 框架扩展至分布式设置,在聚合多个独立模型结果的同时保持 FDR 控制。
  • 提供一种稳健、稳定且通信高效的替代方法,以应对现有方法(如 Lasso 或基于 OLS 的聚合)在 FDP 变异性强或缺乏 FDR 保证方面的不足。

提出的方法

  • 在 $ m $ 个研究组中的每一个独立应用 knockoff 筛选,以生成与模型相关的 knockoff 统计量,确保每组的精确 FDR 控制。
  • 通过单次通信将汇总统计量(特别是估计系数及其方差)聚合至中心协调者。
  • 对每个特征 $ j $ 计算平均 $ z $-统计量 $ Z_j = \widehat{\beta}_j / \sqrt{\Theta_j} $,其中 $ \widehat{\beta}_j $ 为各组估计值的均值,$ \Theta_j $ 为估计方差的平均值。
  • 对由 $ z $-统计量导出的 $ p $-值应用 Benjamini-Hochberg 过程(BHq),以在名义水平 $ q $ 下控制 FDR。
  • 使用数据驱动的链接函数 $ \Gamma $ 将个体 knockoff 统计量映射为统一的检验统计量,以增强信号放大和稳定性。
  • 通过量化每个组的标量汇总统计量,将通信复杂度控制在 $ O(p \cdot m) $ 位以内(对数因子范围内),实现通信效率。

实验结果

研究问题

  • RQ1在多个独立线性模型于去中心化环境中分析时,能否在有限样本下以非渐近方式实现精确的 FDR 控制?
  • RQ2如何在保持统计功效和 FDR 控制的前提下,最小化大规模元分析中的通信成本?
  • RQ3与 OLS 或 Lasso 等标准方法相比,聚合多个独立模型的 knockoff 统计量是否能提升稳定性并降低错误发现比例(FDP)的变异性?
  • RQ4能否在不依赖噪声方差或信号稀疏性知识的前提下,将 knockoff 框架扩展至去中心化、高维设置?
  • RQ5是否存在一种通信高效的聚合策略,可在允许随机决策规则的同时保持精确的 FDR 控制?

主要发现

  • Knockoff aggregation 在有限样本中实现了精确的 FDR 控制,且无需依赖噪声方差知识或稀疏性假设。
  • 在 $ p = 500 $、$ n_i = 1500 $、$ m = 5 $、$ k = 100 $ 的相关设计下,平均 FDP 为 0.1774,低于名义水平 0.20。
  • Knockoff aggregation 的 FDP 标准差为 0.0493,显著低于 OLS 的 0.1260,表明其在名义水平附近具有更紧密的集中性。
  • 基于 Lasso 的方法平均 FDP 为 0.3458,远超名义水平,表明尽管经过交叉验证,其 FDR 控制仍表现极差。
  • Knockoff aggregation 的 FDP 分布高度集中,无任何实例超过 0.35,而 OLS 展现出极端的变异性,部分重复实验中错误发现率高达 70%。
  • 该方法实现了 $ O(p \cdot m) $ 位的通信复杂度(对数因子范围内),在某些信息论设定下接近最优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。