Skip to main content
QUICK REVIEW

[论文解读] Compositional Covariance Shrinkage and Regularised Partial Correlations

Suzanne Jin, Cédric Notredame|arXiv (Cornell University)|Dec 1, 2022
Geochemistry and Geologic Mapping被引用 5
一句话总结

本文提出了一种针对组成数据中对数比协方差矩阵的新型收缩方法,利用对数比不相关组成作为定制化目标,以在高维、小样本设置下提升估计性能。该方法通过减少单位和约束带来的偏差,改善了偏相关系数的估计,在模拟数据和单细胞RNA-seq数据中均优于标准收缩方法。

ABSTRACT

We propose an estimation procedure for covariation in wide compositional data sets. For compositions, widely-used logratio variables are interdependent due to a common reference. Logratio uncorrelated compositions are linearly independent before the unit-sum constraint is imposed. We show how they are used to construct bespoke shrinkage targets for logratio covariance matrices and test a simple procedure for partial correlation estimates on both a simulated and a single-cell gene expression data set. For the underlying counts, different zero imputations are evaluated. The partial correlation induced by the closure is derived analytically. Data and code are available from GitHub.

研究动机与目标

  • 解决组成数据中单位和约束导致的协方差与偏相关系数估计偏差问题。
  • 为对数比变换后的组成数据开发一种有原则的收缩程序,避免对对数比变量之间独立性的假设。
  • 通过利用对数比不相关组成作为收缩目标,改进偏相关系数的估计——这是识别组成网络中直接相互作用的关键。
  • 在合成数据和真实单细胞基因表达数据上对方法进行基准测试,以验证其在不同样本大小和零值填补策略下的性能表现。
  • 提供一种计算高效且可复现的实现方式,便于在基因组学和组成数据分析中应用。

提出的方法

  • 使用对数比不相关(LU)组成作为基础,定义对数比协方差矩阵的收缩目标,确保与组成约束的结构一致性。
  • 提出两种等价方法:(1) 在对数比变换前收缩基础协方差矩阵;(2) 直接使用基于LU的目标收缩对数比协方差矩阵;优先采用前者以简化实现。
  • 推导LU协方差矩阵的解析逆矩阵,从而可直接从收缩目标计算偏相关系数,避免数值不稳定性。
  • 对基础协方差矩阵应用James-Stein收缩,通过经验协方差与LU目标的凸组合来降低方差。
  • 使用合成数据和重采样的单细胞RNA-seq数据,通过均方误差(MSE)评估性能,涵盖不同零值填补方法。
  • 通过R包中的`bShrink`函数实现该方法,代码托管于GitHub,可与现有工具(如`propr`)无缝集成。

实验结果

研究问题

  • RQ1如何将协方差收缩方法适配于组成数据,以考虑对数比变换变量之间的固有依赖性?
  • RQ2对数比不相关组成能否作为对数比协方差矩阵的最优收缩目标,从而在高维设置下提升估计准确性?
  • RQ3与对数比协方差矩阵的朴素收缩相比,所提出的收缩方法在偏相关系数估计的均方误差方面表现如何?
  • RQ4不同零值填补策略对单细胞基因表达数据中偏相关系数估计性能有何影响?
  • RQ5LU组成中偏相关系数的解析形式在多大程度上改善了对组成网络中直接相互作用的解释?

主要发现

  • 所提出的基于基础协方差矩阵的收缩方法显著降低了对数比协方差估计的均方误差,尤其在小样本情形(N=8至N=40)下效果明显。
  • 在单细胞基因表达数据中,该方法在所有样本大小(N=100至N=2500)下均优于无收缩和朴素收缩方法,且在不同零值填补策略下均保持一致的MSE改进。
  • 对数比不相关组成中偏相关系数的解析表达式证实,该方法在单位和约束下能正确保持条件独立结构。
  • 使用LU组成作为收缩目标,相较于标准方法,能获得更稳定、更准确的偏相关系数估计,尤其在高维、稀疏的组成数据中表现更优。
  • 该方法对单细胞数据中不同零值填补技术具有鲁棒性,性能在各种填补策略下均保持稳定,如箱线图比较所示。
  • R语言中`bShrink`函数的实现使得该方法可直接集成到现有组成数据分析工作流中,例如使用`propr`包进行比例性和偏相关分析的工作流。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。