Skip to main content
QUICK REVIEW

[论文解读] CloudPred: Predicting Patient Phenotypes From Single-cell RNA-seq

Bryan He, Matthew Thomson|arXiv (Cornell University)|Oct 13, 2021
Single-cell and spatial transcriptomics参考文献 20被引用 4
一句话总结

CloudPred 是一种新颖的、可解释的机器学习框架,通过将每位患者的细胞群落建模为可微分的高斯混合模型,直接从单细胞RNA测序数据预测患者表型(如系统性红斑狼疮状态)。其在系统性红斑狼疮数据集上实现了0.98的AUROC,显著优于现有方法,识别出特定的CD4+ T细胞亚群为疾病高度预测性指标,同时处理了患者间细胞计数的可变性,并在不进行伪批量转换的情况下保持了单细胞分辨率。

ABSTRACT

Single-cell RNA sequencing (scRNA-seq) has the potential to provide powerful, high-resolution signatures to inform disease prognosis and precision medicine. This paper takes an important first step towards this goal by developing an interpretable machine learning algorithm, CloudPred, to predict individuals' disease phenotypes from their scRNA-seq data. Predicting phenotype from scRNA-seq is challenging for standard machine learning methods -- the number of cells measured can vary by orders of magnitude across individuals and the cell populations are also highly heterogeneous. Typical analysis creates pseudo-bulk samples which are biased toward prior annotations and also lose the single cell resolution. CloudPred addresses these challenges via a novel end-to-end differentiable learning algorithm which is coupled with a biologically informed mixture of cell types model. CloudPred automatically infers the cell subpopulation that are salient for the phenotype without prior annotations. We developed a systematic simulation platform to evaluate the performance of CloudPred and several alternative methods we propose, and find that CloudPred outperforms the alternative methods across several settings. We further validated CloudPred on a real scRNA-seq dataset of 142 lupus patients and controls. CloudPred achieves AUROC of 0.98 while identifying a specific subpopulation of CD4 T cells whose presence is highly indicative of lupus. CloudPred is a powerful new framework to predict clinical phenotypes from scRNA-seq data and to identify relevant cells.

研究动机与目标

  • 开发一种可直接从单细胞RNA测序数据预测临床表型的机器学习框架,克服标准方法的局限性。
  • 解决患者间细胞计数可变性及scRNA-seq数据高异质性问题,而无需依赖伪批量平均化。
  • 在无需预先注释的情况下,识别出与疾病状态相关的生物学上相关的细胞亚群,实现可解释的表型预测。
  • 构建一种可扩展的端到端可微分模型,利用scRNA-seq数据中的几何结构(作为“点云”)以提升泛化能力。
  • 在真实世界数据集上验证该方法,并提供一个系统性的模拟平台,用于未来scRNA-seq表型预测方法的基准测试。

提出的方法

  • CloudPred 将每位患者的scRNA-seq数据建模为高斯分布的混合模型,其中每个分量代表一个潜在的细胞亚群,其均值和协方差由模型学习得到。
  • 通过随机梯度下降进行端到端可微分优化,联合学习细胞亚群参数与表型预测权重。
  • 该算法将每位患者的细胞群落丰度计算为连续的词袋特征,作为分类器进行表型预测的输入。
  • 与标准聚类不同,CloudPred 优化混合分量不仅基于数据拟合,还基于其对表型的预测能力,训练过程中整合了临床标签。
  • 该方法以无监督聚类进行初始化,但通过表型标签进行微调,以识别出具有生物学意义的亚群。
  • 开发了一套合成数据生成框架,用于模拟具有可控疾病特征和变异性的患者级scRNA-seq数据,以评估方法性能。

实验结果

研究问题

  • RQ1尽管存在细胞计数可变性和高异质性,机器学习模型是否能准确从单细胞RNA测序数据中预测患者表型(如疾病状态)?
  • RQ2端到端可微分混合模型是否在表型预测准确率上优于标准的伪批量或基于聚类的方法?
  • RQ3该模型是否能自动识别出无需依赖先验注释的、与疾病相关的生物学生物学上相关的细胞亚群?
  • RQ4模型性能如何随训练集中患者数量和细胞数量的变化而变化?
  • RQ5该模型是否能识别出其存在或丰度与临床结局(如系统性红斑狼疮或种族)强烈相关的特定细胞类型?

主要发现

  • CloudPred 在从scRNA-seq数据预测系统性红斑狼疮状态时,AUROC达到0.98,显著优于多种评估设置下的其他方法。
  • 该模型识别出特定CD4+ T细胞亚群的丰度对系统性红斑狼疮具有高度预测性,与T细胞在自身免疫中已知的免疫学作用一致。
  • 在系统性红斑狼疮数据集中,即使仅使用20名训练患者,CloudPred仍保持高性能,表明其在小样本数据下具有强大的泛化能力。
  • 性能在每位患者约1,000个细胞后趋于稳定,表明增加患者数量可能比提高每位患者的测序深度更具优势。
  • 在标准CPU上,即使处理100,000个细胞,CloudPred每样本的表型预测时间也少于1秒,表明其具有出色的计算可扩展性。
  • 系统性模拟结果表明,CloudPred在多种合成数据配置下始终优于其他方法,包括DeepSets和伪批量基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。