Skip to main content
QUICK REVIEW

[论文解读] Inference for High-Dimensional Linear Mixed-Effects Models: A Quasi-Likelihood Approach

Sai Li, Tommaso Cai|arXiv (Cornell University)|Jul 13, 2019
Genetic Mapping and Diversity in Plants and Animals参考文献 34被引用 8
一句话总结

本文提出了一种拟似然方法,用于在固定效应维度较大的高维线性混合效应模型中进行估计与推断,采用去偏Lasso技术实现最优速率估计和无需依赖正态性假设的有效统计推断。该方法在小鼠群体研究中能准确识别与BMI相关的遗传变异,相较于标准Lasso方法,通过考虑聚类水平的随机效应而表现更优。

ABSTRACT

Linear mixed-effects models are widely used in analyzing clustered or repeated measures data. We propose a quasi-likelihood approach for estimation and inference of the unknown parameters in linear mixed-effects models with high-dimensional fixed effects. The proposed method is applicable to general settings where the dimension of the random effects and the cluster sizes are possibly large. Regarding the fixed effects, we provide rate optimal estimators and valid inference procedures that do not rely on the structural information of the variance components. We also study the estimation of variance components with high-dimensional fixed effects in general settings. The algorithms are easy to implement and computationally fast. The proposed methods are assessed in various simulation settings and are applied to a real study regarding the associations between body mass index and genetic polymorphic markers in a heterogeneous stock mice population.

研究动机与目标

  • 开发一种计算高效且统计有效的高维线性混合效应模型推断方法,其中固定效应的数量超过样本量。
  • 提供不依赖于方差成分结构假设的最优速率估计量。
  • 在聚类规模较大且固定效应维度较高的情况下,实现对固定效应和方差成分的有效推断。
  • 解决在高维设置下基于似然的方法存在的局限性,如非凸优化和强正态性假设。
  • 展示该方法在具有复杂相关结构的真实世界遗传关联研究中的实用性。

提出的方法

  • 该方法采用拟似然框架,避免完全似然最大化,从而降低计算负担并避免非凸优化。
  • 使用去偏Lasso估计量对固定效应进行估计,校正正则化引入的偏差,以实现有效推断。
  • 通过基于估计估计方程精度矩阵的插值估计量,近似得到“准oracle”信息矩阵。
  • 该方法无需对随机效应或误差项的分布做假设,增强了稳健性。
  • 方差成分通过基于矩量的估计量进行估计,在较弱条件下具有一致性和渐近正态性。
  • 该方法通过两步算法实现:首先利用去偏Lasso估计固定效应,然后利用基于残差的估计量估计方差成分。

实验结果

研究问题

  • RQ1我们能否在不依赖强分布假设的前提下,实现高维线性混合效应模型中固定效应的最优速率估计?
  • RQ2当协变量数量超过样本量时,如何构建固定效应的可靠置信区间和假设检验?
  • RQ3在高维遗传关联研究中,忽略聚类水平随机效应会对推断产生何种影响?
  • RQ4在高维设置下,基于矩量的方差成分估计量是否仍保持有效性和高效性?
  • RQ5与标准Lasso和基于似然的方法相比,该方法在统计功效和第一类错误控制方面表现如何?

主要发现

  • 所提出的去偏Lasso估计量在高维线性混合效应模型中实现了固定效应估计的极小化最大风险率。
  • 该方法生成的固定效应置信区间和p值在模拟中具有接近名义水平的覆盖概率,表明推断有效。
  • 在真实的小鼠遗传学研究中,共识别出13个SNP和性别在FDR ≤ 0.05水平下与BMI显著相关,其中包括Auts2、Immp2l和Crebbp基因中具有生物学合理性的变异。
  • 所提方法的z统计量QQ图与标准正态分布高度一致,表明第一类错误控制良好。
  • 相比之下,标准Lasso(a=0)的QQ图显示出显著偏离正态性,表明其第一类错误率严重膨胀。
  • 笼舍效应的估计方差成分为0.202,标准误为0.018,表明数据中存在显著且强的笼舍水平相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。