[论文解读] PRAGA: Prototype-aware Graph Adaptive Aggregation for Spatial Multi-modal Omics Analysis
PRAGA 提出了一种原型感知的图自适应聚合框架,用于空间多模态组学分析,通过学习动态的、组学特异的图结构来捕捉因测序扰动而被掩盖的潜在语义关系。通过整合贝叶斯高斯混合模型实现动态原型对比学习,PRAGA 在真实数据集上实现了卓越的聚类性能,F1-Score 最高提升 3.54%,NMI 最高提升 3.40%,且无需事先知晓细胞类型数量信息。
Spatial multi-modal omics technology, highlighted by Nature Methods as an advanced biological technique in 2023, plays a critical role in resolving biological regulatory processes with spatial context. Recently, graph neural networks based on K-nearest neighbor (KNN) graphs have gained prominence in spatial multi-modal omics methods due to their ability to model semantic relations between sequencing spots. However, the fixed KNN graph fails to capture the latent semantic relations hidden by the inevitable data perturbations during the biological sequencing process, resulting in the loss of semantic information. In addition, the common lack of spot annotation and class number priors in practice further hinders the optimization of spatial multi-modal omics models. Here, we propose a novel spatial multi-modal omics resolved framework, termed PRototype-Aware Graph Adaptative Aggregation for Spatial Multi-modal Omics Analysis (PRAGA). PRAGA constructs a dynamic graph to capture latent semantic relations and comprehensively integrate spatial information and feature semantics. The learnable graph structure can also denoise perturbations by learning cross-modal knowledge. Moreover, a dynamic prototype contrastive learning is proposed based on the dynamic adaptability of Bayesian Gaussian Mixture Models to optimize the multi-modal omics representations for unknown biological priors. Quantitative and qualitative experiments on simulated and real datasets with 7 competing methods demonstrate the superior performance of PRAGA. Code is available at https://github.com/Xubin-s-Lab/PRAGA.
研究动机与目标
- 解决固定 KNN 图在捕捉因生物测序扰动导致的空间多模态组学数据中潜在语义关系方面的局限性。
- 克服真实空间组学应用中斑点标注和细胞类型先验未知的挑战。
- 开发一种可学习的、自适应的图结构,整合空间邻近性与跨模态特征语义,以提升表征学习效果。
- 提出一种基于贝叶斯高斯混合模型的动态原型对比学习机制,实现在无需预设聚类数量情况下的自监督表征优化。
- 在模拟和真实的空间多模态组学数据集上实现聚类与表征学习的最先进性能。
提出的方法
- 构建一种可学习的、组学特异的图结构,动态适应测序斑点之间的潜在语义关系,替代静态 KNN 图。
- 将空间坐标与多模态组学特征(如转录组学、蛋白质组学)整合进统一的基于图的表征学习框架。
- 采用贝叶斯高斯混合模型(BGMM)建模未知的细胞类型分布,并在开放集环境中实现动态原型学习。
- 设计一种动态原型对比学习损失($\mathcal{L}_{dpcl}$),基于演化中的特征表示自适应地识别并优化聚类原型。
- 引入同质性损失($\mathcal{L}_h$)和重建损失($\mathcal{L}_{recon}$),以增强特征一致性与表征保真度。
- 采用带自适应温度缩放的指数移动平均(EMA)方法,稳定对比学习过程并提升鲁棒性。
实验结果
研究问题
- RQ1在生物噪声存在的情况下,可学习的动态图结构是否能优于固定 KNN 图,以更好地捕捉空间多模态组学数据中的潜在语义关系?
- RQ2当细胞类型先验未知时,基于贝叶斯高斯混合模型的动态原型对比学习在表征学习方面有何提升作用?
- RQ3与当前最先进方法相比,PRAGA 在多样化空间组学数据集上的聚类性能提升程度如何?
- RQ4PRAGA 的性能对超参数(如初始聚类数、温度和损失权重)的敏感性如何?
- RQ5当初始聚类数偏离真实细胞类型数时,PRAGA 是否仍能保持高性能?
主要发现
- 在人类淋巴结数据集上,PRAGA 相较基线方法实现了 F1-Score 提升 3.54% 和 NMI 提升 3.40%。
- 在空间表观基因组-转录组小鼠脑数据集上,PRAGA 实现了 F1-Score 提升 2.01% 和 NMI 提升 1.54%。
- 在模拟数据集上,PRAGA 实现了 F1-Score 提升 1.26% 和 NMI 提升 2.08%。
- 消融实验表明,若移除可学习图、同质性损失、重建损失或动态原型对比损失,性能均出现显著下降。
- 超参数敏感性分析显示,PRAGA 对超参数变化具有鲁棒性,包括初始聚类数、EMA 速度($\alpha$)、温度($\tau$)和损失权重($\beta$)。
- 当初始聚类数与真实值匹配时,PRAGA 达到最佳性能;然而,即使初始聚类数错误,其性能依然保持良好,表明在真实世界不确定性下具备强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。