Skip to main content
QUICK REVIEW

[论文解读] A Guideline for the Statistical Analysis of Compositional Data in Immunology

Jinkyung Yoo, Zequn Sun|arXiv (Cornell University)|Jan 20, 2022
Oral microbiology and periodontitis research被引用 4
一句话总结

本文为免疫细胞组成数据的统计分析提供了全面的指导原则,强调使用组成数据分析方法以避免得出误导性结论。文章对比了对数比回归与狄利克雷回归,表明两种方法均有效,但得出的显著性结果不同:对数比回归识别出四种免疫细胞类型(T.cells.CD4、B.cells、T.cells.CD8、巨噬细胞)与种族显著相关,而狄利克雷回归仅识别出其中两种。

ABSTRACT

The study of immune cellular composition has been of great scientific interest in immunology because of the generation of multiple large-scale data. From the statistical point of view, such immune cellular data should be treated as compositional. In compositional data, each element is positive, and all the elements sum to a constant, which can be set to one in general. Standard statistical methods are not directly applicable for the analysis of compositional data because they do not appropriately handle correlations between the compositional elements. In this paper, we review statistical methods for compositional data analysis and illustrate them in the context of immunology. Specifically, we focus on regression analyses using log-ratio transformations and the generalized linear model with Dirichlet distribution, discuss their theoretical foundations, and illustrate their applications with immune cellular fraction data generated from colorectal cancer patients.

研究动机与目标

  • 解决在分析免疫细胞组成数据时面临的统计挑战,这些数据由于其和为常数的性质而本质上属于组成数据。
  • 强调在将标准统计方法应用于组成数据时的局限性,特别是虚假相关性和缺乏尺度不变性。
  • 为免疫学家和统计学家提供一种实用且基于证据的指导原则,以选择合适的组成数据分析方法。
  • 在真实免疫细胞分数数据的背景下,比较两种关键方法——对数比回归与狄利克雷回归——在性能和可解释性方面的差异。
  • 展示方法选择对识别显著关联的影响,特别是结直肠癌中免疫细胞组成与患者种族之间的关联。

提出的方法

  • 采用艾奇森单纯形几何方法,将免疫细胞分数建模为 $S^D$ 中的组成数据,其中各成分之和为1且为正数。
  • 应用加法对数比(ALR)变换,将组成数据转换到实数空间,从而可使用具有尺度不变性的标准回归模型。
  • 使用ALR变换后的响应变量拟合多元对数对比回归模型,其系数对参考组分的选择具有不变性。
  • 实施狄利克雷回归,直接对组成响应变量建模,假设细胞分数服从狄利克雷分布,并在协变量上设置线性预测器。
  • 使用复合残差图和分量过离散统计量评估模型拟合效果并检测影响性观测值。
  • 通过诊断图和统计检验验证模型假设,包括同方差性和过离散性。

实验结果

研究问题

  • RQ1对数比回归与狄利克雷回归在识别结直肠癌中免疫细胞组成与患者种族之间显著关联方面的表现如何比较?
  • RQ2在组成免疫细胞数据上使用标准统计方法会产生何种影响?为何这些方法不适用?
  • RQ3在免疫细胞分数分析的背景下,对数比回归与狄利克雷回归在可解释性和统计特性方面有何不同?
  • RQ4同方差性和过离散性等模型假设在多大程度上影响组成数据分析结论的可靠性?
  • RQ5统计方法的选择是否会导致不同的生物学结论,特别是在识别种族差异的关键免疫细胞标志物方面?

主要发现

  • 对数比回归识别出四种免疫细胞类型——T.cells.CD4、B.cells、T.cells.CD8 和 巨噬细胞——与种族显著相关,而狄利克雷回归仅识别出其中两种。
  • ALR变换所得的对数对比系数对参考组分的选择具有不变性,支持了对数比方法的稳健性。
  • 狄利克雷模型的复合残差图显示,少数观测值的残差超过40,但大多数残差低于20,表明模型整体拟合良好。
  • 分量过离散性图显示整体上无显著的过离散问题,尽管某些特定细胞类型存在少数极端值。
  • 在两种模型中,年龄对免疫细胞组成均无显著影响,表明在本分析中种族是主要关注变量。
  • T.cells.CD4 与 B.cells 的总和与 T.cells.CD8 与 巨噬细胞 的总和之比被识别为能有效区分两组种族的有意义汇总统计量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。