[论文解读] A joint model of unpaired data from scRNA-seq and spatial transcriptomics for imputing missing gene expression measurements
gimVI 是一个深度生成模型,整合未配对的 scRNA-seq 与空间转录组数据以推断缺失基因,使用变分推断和一个可控域自适应项的可调整潜在空间。
Spatial studies of transcriptome provide biologists with gene expression maps of heterogeneous and complex tissues. However, most experimental protocols for spatial transcriptomics suffer from the need to select beforehand a small fraction of genes to be quantified over the entire transcriptome. Standard single-cell RNA sequencing (scRNA-seq) is more prevalent, easier to implement and can in principle capture any gene but cannot recover the spatial location of the cells. In this manuscript, we focus on the problem of imputation of missing genes in spatial transcriptomic data based on (unpaired) standard scRNA-seq data from the same biological tissue. Building upon domain adaptation work, we propose gimVI, a deep generative model for the integration of spatial transcriptomic data and scRNA-seq data that can be used to impute missing genes. After describing our generative model and an inference procedure for it, we compare gimVI to alternative methods from computational biology or domain adaptation on real datasets and outperform Seurat Anchors, Liger and CORAL to impute held-out genes.
研究动机与目标
- 将 scRNA-seq 与空间转录组数据整合到一个共享潜在空间,以实现缺失基因的推断。
- 开发一个生成模型,考虑两种模态之间的技术特异性共变量偏移。
- 提供一个概率框架,量化推断的不确定性。
- 在真实数据集上对 gimVI 与现有方法(Liger、Seurat、CORAL、MAGAN)进行基准比较。
- 探索推断质量如何与潜在空间对齐和基因可观测性相关。
提出的方法
- 在 scVI 的基础上扩展,加入一个共享潜在变量 z 和用于捕获测序深度与协议效应的模态特异变量。
- 用合适的分布建模观测计数(scRNA-seq 使用 ZINB,空间数据使用 Poisson/NB),条件于 z 和扰动变量。
- 使用神经网络将 z,s 映射到基因频率期望,通过 softmax 层得到用于推断的 rho。
- 进行高斯后验的变分推断 q_phi(z, l | x,s) 与 q_psi(z | x',s),并优化带 KL 正则化的下界。
- 通过从潜在后验采样并使用 g_eta 网络预测反事实表达来进行未观测基因的推断,结合领域自适应理论(用对抗损失逼近 H-发散)。
- 通过联合潜在空间整合度量(混合熵、最近邻纯度)和推断性能(Spearman rho)在真实数据集(mSMS、mPFC)上进行基准评估。
实验结果
研究问题
- RQ1未配对的 scRNA-seq 与空间转录组数据是否可以嵌入到一个共同的潜在空间中,以实现对缺失基因的准确推断?
- RQ2gimVI 是否在数据集整合质量与生物学信息保留之间取得平衡,并且能够量化推断的不确定性?
- RQ3在不同的空间模态数据集上,gimVI 的推断性能与 Seurat、Liger、scVI、CORAL 与 MAGAN 相比如何?
- RQ4领域自适应参数 kappa 对整合与推断性能有何影响?
- RQ5在组织上下文中可视化推断时,对待推断基因的可信度与空间一致性是否得到体现?
主要发现
- gimVI 在数据集整合与生物信号保留之间取得有利的权衡,在两组数据对中在整合度量上优于竞争方法。
- 在推断方面,gimVI 显著提升了推断基因的 Spearman 相关性,在若干设置中获得了相对显著的提升。
- 改变领域自适应参数 kappa,gimVI 在某些数据集上可以优于 kappa=0 和 kappa=1 的情况(kappa* 调优)。
- gimVI 提供带不确定性量化的概率推断,与仅给出点估计的非生成方法不同。
- 在组织上下文(如 mSMS 的 Lamp5 示例)中,推断基因的空间一致性优于竞争方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。