[论文解读] Uncertainty Quantification in Multivariate Mixed Models for Mass Cytometry Data
本文提出两种贝叶斯多变量混合模型——多变量泊松对数正态混合模型和逻辑斯蒂线性混合模型——用于在单细胞质谱流式细胞术数据中进行不确定性量化,同时保留原始单细胞多变量结构。在一项妊娠研究中的应用表明,该模型在控制混杂因素的同时,揭示了从第一孕期到第三孕期蛋白间相关性增加的趋势,并且相较于基于汇总统计的方法,具有更高的可重复性。
Mass cytometry technology enables the simultaneous measurement of over 40 proteins on single cells. This has helped immunologists to increase their understanding of heterogeneity, complexity, and lineage relationships of white blood cells. Current statistical methods often collapse the rich single-cell data into summary statistics before proceeding with downstream analysis, discarding the information in these multivariate datasets. In this article, our aim is to exhibit the use of statistical analyses on the raw, uncompressed data thus improving replicability, and exposing multivariate patterns and their associated uncertainty profiles. We show that multivariate generative models are a valid alternative to univariate hypothesis testing. We propose two models: a multivariate Poisson log-normal mixed model and a logistic linear mixed model. We show that these models are complementary and that either model can account for different confounders. We use Hamiltonian Monte Carlo to provide Bayesian uncertainty quantification. Our models applied to a recent pregnancy study successfully reproduce key findings while quantifying increased overall protein-to-protein correlations between first and third trimester.
研究动机与目标
- 解决将单细胞质谱流式细胞术数据汇总为统计量所导致的信息损失问题。
- 开发能够保留多变量依赖关系并量化高维单细胞数据中不确定性的统计模型。
- 利用混合效应结构对混杂因素(碰撞和管道类型)进行建模,以提高模型的稳健性。
- 证明多变量生成模型在检测生物相关模式方面优于单变量假设检验。
- 实现复杂单细胞免疫学实验设计的可重复、带有不确定性的分析。
提出的方法
- 使用多变量泊松对数正态混合模型(PLMM)对具有过度离散性和标记物之间相关性的计数数据进行建模。
- 应用逻辑斯蒂线性混合模型(LLMM)对具有供者特异性随机效应的二值标记物表达状态进行建模。
- 采用哈密顿蒙特卡洛(HMC)方法进行完整的贝叶斯后验推断和不确定性量化。
- 引入供者和样本的随机效应,以考虑层级化的供者间变异。
- 采用两种互补模型:PLMM用于连续计数数据,LLMM用于二值表达状态,从而实现对混杂因素的稳健检测。
- 开发了两个R包——CytoGLMM和cytoeffect——用于端到端分析,包含可复现的教程文档和自动数据下载功能。
实验结果
研究问题
- RQ1与基于汇总统计的方法相比,多变量生成模型是否能更有效地保留并量化原始质谱流式细胞术数据中的不确定性?
- RQ2蛋白间相关性在妊娠各孕期之间如何变化?这些变化能否以带有不确定性的可靠方式量化?
- RQ3碰撞和管道类型等混杂因素在多大程度上影响单细胞数据中的差异表达分析?如何对这些因素进行建模?
- RQ4结合HMC的贝叶斯混合模型是否能提供比单变量检验或中位数汇总方法更准确且可重复的推断结果?
- RQ5在复杂实验设计中,模型选择(PLMM与LLMM)对检测生物相关模式的影响如何?
主要发现
- 模型成功复现了原始妊娠研究中的关键发现,包括第三孕期相比第一孕期蛋白间相关性增加。
- 多变量泊松对数正态混合模型(PLMM)有效捕捉了单细胞标记物计数中的过度离散性和相关性,后验检查显示大多数标记物的拟合效果良好。
- 逻辑斯蒂线性混合模型(LLMM)在二值标记物表达的推断中表现稳健,尤其在特定标记物低表达或高表达的细胞亚群中表现更优。
- 使用八个CPU核心运行时,PLMM对180,000个细胞(16名供者)的拟合耗时约六天,凸显计算成本是主要限制因素。
- 将样本量缩减至每名供者1,000个细胞对固定效应和标准误影响较小,但对相关性比较的影响较大,表明完整数据分析对准确推断相关性至关重要。
- 后验模型检查发现pERK1/2在特定细胞亚群中存在模型拟合不足,提示未来工作需引入零膨胀扩展模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。