Skip to main content
QUICK REVIEW

[论文解读] varbvs: Fast Variable Selection for Large-scale Regression

Peter Carbonetto, Xiang Zhou|arXiv (Cornell University)|Sep 19, 2017
Genetic and phenotypic traits in livestock参考文献 1被引用 10
一句话总结

该论文提出 varbvs,一种用于大规模回归的快速贝叶斯变量选择方法,利用变分推断高效识别高维数据中的重要预测变量。该方法实现线性计算复杂度,在标准笔记本电脑上完成准确的后验推断仅需不到4分钟,相较于单标记方法在检测遗传数据中的真实数量性状位点方面表现更优。

ABSTRACT

We introduce varbvs, a suite of functions written in R and MATLAB for regression analysis of large-scale data sets using Bayesian variable selection methods. We have developed numerical optimization algorithms based on variational approximation methods that make it feasible to apply Bayesian variable selection to very large data sets. With a focus on examples from genome-wide association studies, we demonstrate that varbvs scales well to data sets with hundreds of thousands of variables and thousands of samples, and has features that facilitate rapid data analyses. Moreover, varbvs allows for extensive model customization, which can be used to incorporate external information into the analysis. We expect that the combination of an easy-to-use interface and robust, scalable algorithms for posterior computation will encourage broader use of Bayesian variable selection in areas of applied statistics and computational biology. The most recent R and MATLAB source code is available for download at Github (https://github.com/pcarbo/varbvs), and the R package can be installed from CRAN (https://cran.r-project.org/package=varbvs).

研究动机与目标

  • 开发一种计算高效的贝叶斯变量选择方法,适用于高维回归场景。
  • 实现在大规模遗传数据(如全基因组关联研究)中变量包含概率的准确推断。
  • 在保持统计准确性的同时,减轻传统马尔可夫链蒙特卡洛或单标记方法的计算负担。
  • 提供数值稳定且可扩展的实现,适用于包含数千个预测变量和样本的实际应用场景。
  • 通过合理选择先验和后验近似,支持不确定性量化。

提出的方法

  • 该方法基于变量间条件独立性的假设,采用变分近似来逼近后验分布。
  • 使用坐标上升算法优化后验边际对数似然的变分下界,实现在样本量和预测变量数量上的线性时间复杂度。
  • 算法中引入了数值稳定的矩阵运算更新方式,特别是计算 XᵀDX 的对角元素,以防止因浮点数误差导致的过早收敛。
  • 基于贝叶斯线性模型的既有研究提供默认先验,通过经验贝叶斯方法估计超参数,以降低对先验选择的敏感性。
  • 模型包含一个协变量(如体重),并将所有 SNP 联合建模为表型(如睾丸重量)的预测变量,支持多标记推断。
  • 计算每个变量的后验包含概率(PIPs),结果可通过染色体分组可视化,以识别关注区域。

实验结果

研究问题

  • RQ1快速变分推断方法是否能在包含数千个预测变量的大规模回归中实现准确的变量选择?
  • RQ2与单标记方法相比,多标记贝叶斯变量选择在识别遗传数据中真实数量性状位点方面表现如何?
  • RQ3高维贝叶斯模型中矩阵运算的数值不稳定性在多大程度上影响收敛性和解的质量?
  • RQ4默认先验是否能在无需大量超参数调优的情况下提供稳健的推断?
  • RQ5结果对变分参数初始化的敏感性如何?能否通过优化初始化策略改善收敛性?

主要发现

  • varbvs 算法在标准笔记本电脑上,于 993 只小鼠、79,748 个 SNP 的数据上完成模型拟合仅用时不到 4 分钟,展现出极高的计算效率。
  • 仅有 3 个 SNP 的后验包含概率大于 0.5,解释了调整体重后睾丸重量残差方差的 15%。
  • 排名第一的 SNP(rs6279141)的后验包含概率为 1.00,解释了 6.31% 的方差,位于与睾丸形态发生相关的 Inhba 基因附近。
  • 该方法在染色体 2 上识别出单标记分析遗漏的 QTL,凸显了多标记建模在检测相关信号方面的优势。
  • 通过重新排序矩阵运算,数值稳定性显著提升:更稳定的更新方式(xdx2)实现了更平滑的收敛,并避免了过早终止。
  • varbvs 得到的后验包含概率与单标记 p 值高度一致,验证了该方法在考虑 SNP 间相关性的同时准确检测真实关联的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。