[论文解读] Decomposing feature-level variation with Covariate Gaussian Process Latent Variable Models
本文提出协变量高斯过程潜在变量模型(c-GPLVM),这是一种新颖的概率框架,可将高维数据中的特征级变异分解为潜在变量、观测协变量及其非线性交互作用的贡献。通过在高斯过程框架内整合结构化核分解,c-GPLVM 实现了可解释的、可扩展的降维,同时明确分离了由潜在结构与外部协变量解释的方差,该方法在基因表达和生存数据上的表现已得到验证。
The interpretation of complex high-dimensional data typically requires the use of dimensionality reduction techniques to extract explanatory low-dimensional representations. However, in many real-world problems these representations may not be sufficient to aid interpretation on their own, and it would be desirable to interpret the model in terms of the original features themselves. Our goal is to characterise how feature-level variation depends on latent low-dimensional representations, external covariates, and non-linear interactions between the two. In this paper, we propose to achieve this through a structured kernel decomposition in a hybrid Gaussian Process model which we call the Covariate Gaussian Process Latent Variable Model (c-GPLVM). We demonstrate the utility of our model on simulated examples and applications in disease progression modelling from high-dimensional gene expression data in the presence of additional phenotypes. In each setting we show how the c-GPLVM can extract low-dimensional structures from high-dimensional data sets whilst allowing a breakdown of feature-level variability that is not present in other commonly used dimensionality reduction approaches.
研究动机与目标
- 开发一种降维模型,明确建模特征级变异如何依赖于潜在的低维结构和观测协变量。
- 实现高维数据中方差的可解释分解,分解为潜在变量、协变量及其非线性交互作用的贡献。
- 解决标准 GPLVM 的局限性,即在学习潜在结构时未能考虑混杂协变量效应。
- 为复杂数据中的发现提供框架,例如在疾病进展建模中,理解基因对潜在因素和协变量因素的特异性响应至关重要。
- 通过以保持可解释性的方式整合协变量信息,扩展 GPLVM,同时支持特征级可变性的事后分析。
提出的方法
- c-GPLVM 使用混合高斯过程模型,其结构化核将从联合潜在-协变量空间的映射分解为可加成分和交互成分。
- 它将每个特征的表达建模为潜在变量 z 和协变量 x 的高斯过程函数,其核函数明确分离了可加效应和交互效应。
- 该模型联合推断潜在坐标上的后验分布 p(z|y,x) 和特征特定映射 p(f^(j)|y,x,z),从而实现在特征层面的方差分解。
- 其关键创新在于使用结构化核分解,以非线性、非参数方式实现对来自 z、x 和 z×x 交互作用的方差贡献的解耦。
- 该方法采用可扩展的推断技术,包括稀疏 GP 近似,以处理大规模高维数据集,如基因表达谱。
- 该框架支持发现应用和对混杂协变量(如批次效应或临床数据中的生存时间)的调整。
实验结果
研究问题
- RQ1我们如何将高维数据中的特征级变异分解为潜在变量、观测协变量及其非线性交互作用的贡献?
- RQ2我们能否学习一种协变量调整后的潜在表示,以揭示在不同协变量值下共享的结构,同时保持可解释性?
- RQ3c-GPLVM 在捕捉现实世界生物数据中复杂非线性依赖关系方面,与标准 GPLVM 及其监督扩展相比,性能提升程度如何?
- RQ4在癌症进展建模中,我们如何识别其表达受潜在进展、生存时间或其交互作用驱动的基因?
- RQ5该模型能否在原则性的概率框架中有效处理右删失的协变量(如生存时间)?
主要发现
- c-GPLVM 即使在连续协变量(如生存时间)存在混杂效应时,仍能成功捕捉高维基因表达数据中的潜在结构,在建模特征级变异方面优于标准 GPLVM。
- 在模拟数据中,c-GPLVM 准确恢复了潜在维度和协变量维度中方差真实分解为可加效应和交互效应的结果。
- 在 TCGA 乳腺癌数据中,c-GPLVM 识别出 TSPAN1 基因的表达沿潜在进展坐标升高,提示其在疾病进展中的作用独立于生存时间。
- 该模型揭示 KRT23 基因存在显著的协变量可加效应:生存时间越长的患者表达水平越高,提示其可能具有保护作用。
- 对于 LPL 基因,c-GPLVM 检测到复杂的非线性交互作用:在特定潜在坐标范围内,高表达与生存率降低相关,提示其在肿瘤侵袭性中具有情境依赖性作用。
- c-GPLVM 的核分解使我们能够直接识别出三种不同的基因行为类型——仅受潜在变量驱动、协变量可加效应驱动、交互作用驱动——而无需事后分析或模型修改。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。