Skip to main content
QUICK REVIEW

[论文解读] Computing log-likelihood and its derivatives for restricted maximum likelihood methods

Shengxin Zhu|arXiv (Cornell University)|Aug 25, 2016
Genetic Mapping and Diversity in Plants and Animals参考文献 31被引用 4
一句话总结

本文提出了一种高效的计算框架,用于在大规模线性混合模型的限制最大似然(REML)估计中计算对数似然及其导数。通过利用矩阵变换和平均信息拆分技术,该方法将雅可比矩阵中计算成本高昂的迹项减少为四项矩阵-向量乘法,从而通过采用稀疏线性求解器与多frontal LDL^T分解实现可扩展的牛顿-拉夫森优化。

ABSTRACT

Recent large scale genome wide association analysis involves large scale linear mixed models. Quantifying (co)-variance parameters in the mixed models with a restricted maximum likelihood method results in a score function which is the first derivative of a log-likelihood. To obtain a statistically efficient estimate of the variance parameters, one needs to find the root of the score function via the Newton method. Most elements of the Jacobian matrix of the score involve a trace term of four parametric matrix-matrix multiplications. It is computationally prohibitively for large scale data sets. By a serial matrix transforms and an averaged information splitting technique, an approximate Jacobian matrix can be obtained by splitting the average of the Jacobian matrix and its expected value. In the approximated Jacobian, its elements only involve Four matrix vector multiplications which can be efficiently evaluated by solving sparse linear systems with the multi-frontal factorization method.

研究动机与目标

  • 解决大规模线性混合模型REML估计中的计算瓶颈,特别是在全基因组关联研究中。
  • 克服得分函数雅可比矩阵中迹项计算的高昂成本。
  • 开发一种数值稳定且可扩展的方法,以计算高维数据的对数似然及其导数。
  • 通过使用平均信息拆分近似雅可比矩阵,实现REML中高效牛顿-拉夫森优化。
  • 提供对数似然导数的自包含推导,以提高新研究者对方法的可访问性与可复现性。

提出的方法

  • 应用序列矩阵变换,将复杂的雅可比矩阵分解为可管理的组成部分。
  • 引入平均信息拆分技术,将雅可比矩阵分离为主部与可忽略的期望部分。
  • 仅使用主部近似雅可比矩阵,其元素依赖于涉及观测向量的二次型。
  • 将每个二次型简化为四项矩阵-向量乘法,通过稀疏线性系统高效求解。
  • 利用多frontal或超节点LDL^T分解,求解具有相同系数矩阵的多个右端项系统。
  • 基于稀疏精度矩阵C的LDL^T分解进行似然评估,该矩阵的规模小于观测数。

实验结果

研究问题

  • RQ1如何近似REML雅可比矩阵中的迹项,以降低大规模模型中的计算成本?
  • RQ2何种矩阵分解技术可实现高维线性混合模型中对数似然导数的高效评估?
  • RQ3能否通过使用平均信息拆分近似海塞矩阵,使牛顿-拉夫森方法在REML估计中实现可扩展性?
  • RQ4与现有无导数或完整雅可比方法相比,所提方法在效率和准确性方面表现如何?
  • RQ5稀疏矩阵分解在实现基因组数据可扩展REML计算中扮演何种角色?

主要发现

  • 所提出的平均信息拆分技术能有效将雅可比矩阵分离为主导部分与可忽略的期望部分,显著降低计算复杂度。
  • 近似雅可比矩阵的元素仅依赖于四项矩阵-向量乘积,可通过稀疏线性求解高效计算。
  • 该方法将二阶导数的评估简化为求解多个具有相同系数矩阵C的线性系统,从而实现因子分解的重复利用。
  • 该方法在高通量生物数据(如全基因组关联研究)中实现了可扩展的REML估计。
  • 对数似然导数的自洽推导为从业者和研究人员提供了清晰且易于理解的参考。
  • 采用多frontal LDL^T分解确保了稀疏大规模问题的数值稳定性和计算效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。