Skip to main content
QUICK REVIEW

[论文解读] A Unified Probabilistic Model for Learning Latent Factors and Their Connectivities from High-Dimensional Data

Ricardo Pio Monti, Aapo Hyvärinen|arXiv (Cornell University)|May 24, 2018
Advanced Graph Neural Networks被引用 6
一句话总结

该论文提出了一种统一的概率模型,通过使用非负正交因子载荷矩阵来强制变量间的社区结构,联合学习高维数据中的潜在因子及其连接结构。该方法能够同时实现变量聚类和组间连接性的估计,适用于多个相关类别(如fMRI中的受试者),在合成数据和真实fMRI数据上均优于标准因子分析和PCA,模型拟合度和运行时间均有提升。

ABSTRACT

Connectivity estimation is challenging in the context of high-dimensional data. A useful preprocessing step is to group variables into clusters, however, it is not always clear how to do so from the perspective of connectivity estimation. Another practical challenge is that we may have data from multiple related classes (e.g., multiple subjects or conditions) and wish to incorporate constraints on the similarities across classes. We propose a probabilistic model which simultaneously performs both a grouping of variables (i.e., detecting community structure) and estimation of connectivities between the groups which correspond to latent variables. The model is essentially a factor analysis model where the factors are allowed to have arbitrary correlations, while the factor loading matrix is constrained to express a community structure. The model can be applied on multiple classes so that the connectivities can be different between the classes, while the community structure is the same for all classes. We propose an efficient estimation algorithm based on score matching, and prove the identifiability of the model. Finally, we present an extension to directed (causal) connectivities over latent variables. Simulations and experiments on fMRI data validate the practical utility of the method.

研究动机与目标

  • 解决在高维数据中直接估计所有变量间连接结构不可行的挑战。
  • 在单一概率框架中整合变量聚类(社区检测)与潜在连接性估计。
  • 实现多个相关类别(如受试者或条件)的联合建模,共享社区结构但允许不同的连接模式。
  • 提供一种在统计上可识别且可扩展的无向和有向潜在连接性估计方法。
  • 在fMRI数据上验证该方法,展示其模型拟合度提升和生物学可解释性。

提出的方法

  • 该模型通过允许潜在因子之间具有完整的协方差(非对角)来扩展因子分析,同时约束因子载荷矩阵为非负且正交,以编码社区成员身份。
  • 载荷矩阵的结构确保每个观测变量属于一个或多个社区,非负载荷增强了模型的可解释性。
  • 提出一种基于得分匹配的高效估计算法,实现快速且稳定的参数学习,无需完整似然最大化。
  • 通过潜在贝叶斯网络将模型扩展至有向连接性,允许对潜在因子进行因果结构估计。
  • 在多类别情形下,社区结构(载荷矩阵)在各类别间共享,而连接性(因子协方差)则允许在每类中独立变化。
  • 通过在保留数据上进行交叉验证,选择潜在因子数量(k)。

实验结果

研究问题

  • RQ1统一的概率模型能否在高维数据中联合学习潜在社区结构和组间连接性?
  • RQ2如何在多个相关类别间强制共享社区结构,同时允许类别特定的连接模式?
  • RQ3所提出的方法在模型拟合度和计算效率方面能否优于标准因子分析、PCA和图模型?
  • RQ4该方法能否在fMRI数据中恢复出具有生物学意义的大脑模块和连接性差异,特别是在健康对照组与ASD受试者之间?
  • RQ5在所提出的约束条件下,该模型是否具有可识别性?能否扩展至有向(因果)连接性?

主要发现

  • 在未见的fMRI数据上,该方法的平均对数似然为 -163.76(±8.86),显著优于非负PCA(-190.47)、因子分析(-193.89)和Gaussian graphical model(-198.58)。
  • 当k=5个潜在模块时,估计出的大脑模块表现出强烈的空间一致性与左右半球对称性,与已知神经解剖学一致。
  • 该方法检测到ASD受试者中额顶叶(模块2)与枕叶(模块1)或边缘-颞叶(模块3)区域之间的连接性显著增强,与现有文献一致。
  • 经过Bonferroni校正的置换检验确认,有17条边在ASD中表现出显著的模块间连接性增加(p < 0.01),支持其生物学合理性。
  • 该方法比FOFC快得多,其平均运行时间随观测变量数(p)的增加而呈有利的缩放趋势。
  • 在单类别设置下,该方法与FOFC表现相当;但在多类别设置下,其在模型拟合度和可扩展性方面均优于所有基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。