Skip to main content
QUICK REVIEW

[论文解读] A rate optimal procedure for sparse signal recovery under dependence

Jun Li, Ping‐Shou Zhong|arXiv (Cornell University)|Oct 10, 2014
Sparse and Compressive Sensing Techniques参考文献 19被引用 3
一句话总结

本文提出了一种依赖辅助阈值化与剔除(DATE)程序,用于在具有依赖随机向量的高维设置下进行稀疏信号恢复。通过利用变量间的依赖关系,DATE在边际错误非发现率(mFNR)方面实现了比独立数据更快的最优收敛速度,同时将边际错误发现率(mFDR)控制在预设水平,展示了在依赖结构下信号识别能力的提升。

ABSTRACT

The paper considers the problem of identifying the sparse different components between two high dimensional means of column-wise dependent random vectors. We show that the dependence can be utilized to lower the identification boundary for signal recovery. Moreover, an optimal convergence rate for the marginal false non-discovery rate (mFNR) is established under the dependence. The convergence rate is faster than the optimal rate without dependence. To recover the sparse signal bearing dimensions, we propose a Dependence-Assisted Thresholding and Excising (DATE) procedure, which is shown to be rate optimal for the mFNR with the marginal false discovery rate (mFDR) controlled at a pre-specified level. Simulation studies and case study are given to demonstrate the performance of the proposed signal identification procedure.

研究动机与目标

  • 为解决在列向依赖的高维数据中识别稀疏信号的挑战,此类情况在基因组学和组学研究中普遍存在。
  • 研究变量间的依赖关系如何影响信号识别边界,特别是依赖关系是否能降低成功恢复信号的阈值。
  • 在依赖结构下建立边际错误非发现率(mFNR)的最优收敛速率,证明其快于独立情况下的收敛速率。
  • 开发一种实用的、最优速率的程序,在依赖存在的情况下控制mFDR的同时最小化mFNR。
  • 通过模拟研究和染色体X上差异表达基因的真实案例研究,验证该方法。

提出的方法

  • 提出DATE(依赖辅助阈值化与剔除)程序,通过估计的协方差矩阵将依赖结构整合到信号检测中。
  • 采用基于检验统计量的阈值规则,该规则考虑了依赖结构,从而在检测功效上优于标准方法。
  • 使用数据驱动的方法估计协方差矩阵Σ,以建模变量间的依赖关系,实现精确的信号识别。
  • 通过一种针对依赖结构改进的Benjamini-Hochberg型程序,将边际错误发现率(mFDR)控制在预设水平。
  • 推导出在依赖结构下mFNR的最优收敛速率,证明其严格快于独立情况下的收敛速率。
  • 将该方法应用于高维两样本均值比较,将数据建模为X_ij = μ_i + ε_ij,其中ε_ij为i.i.d. N(0, Σ_i),并聚焦于δ = μ_1 - μ_2。

实验结果

研究问题

  • RQ1高维变量间的依赖关系如何影响稀疏信号恢复中的信号识别边界?
  • RQ2是否可以利用依赖结构,使边际错误非发现率(mFNR)的最优收敛速率快于独立数据?
  • RQ3在一般依赖结构下,mFNR的最优收敛速率是什么?与独立情况相比如何?
  • RQ4是否存在一种实用程序,能在控制mFDR于预设水平的同时实现该最优收敛速率?
  • RQ5在有限样本下,所提出的DATE程序与现有方法(如BH)在mFDR、mFNR和真正发现率方面相比表现如何?

主要发现

  • 在依赖结构下,信号识别边界严格低于独立情况,意味着在考虑依赖关系时,可使用更弱的效果大小恢复信号。
  • 在依赖结构下,边际错误非发现率(mFNR)的最优收敛速率快于独立情况下的收敛速率,证明了利用依赖关系的理论优势。
  • DATE程序在控制mFDR于预设水平的同时,实现了mFNR的最优收敛速率,因此在依赖设定下为速率最优。
  • 模拟研究显示,DATE在各种稀疏度水平和信号强度下均保持低mFDR(约0.03–0.05)和低mFNR(约0.005–0.007),优于BH程序。
  • 在染色体X的案例研究中,DATE在FDR = 0.001时识别出39个差异表达基因,而BH仅识别出27个,其中22个基因为两者共有,表明DATE具有更高的灵敏度。
  • 该方法对协方差矩阵的误设具有鲁棒性,DATE_Ω̂(使用估计的Ω̂)的表现与DATE_Σ(使用真实Σ)非常接近。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。