Skip to main content
QUICK REVIEW

[论文解读] Sample Size Dependent Species Models

Mingyuan Zhou, Stephen G. Walker|arXiv (Cornell University)|Oct 12, 2014
Bayesian Methods and Mixture Models参考文献 54被引用 3
一句话总结

本文提出了一种基于广义负二项分布过程的样本量依赖型物种模型,实现了对Simpson多样性指数的灵活、非参数贝叶斯估计。通过建模依赖于样本量的聚类结构,该方法在模拟及真实基因组和免疫组学数据集中,相较于传统交换性划分模型,显著提高了从测序计数数据中估计物种均匀度的准确性。

ABSTRACT

Motivated by the fundamental problem of measuring species diversity, this paper introduces the concept of a cluster structure to define an exchangeable cluster probability function that governs the joint distribution of a random count and its exchangeable random partitions. A cluster structure, naturally arising from a completely random measure mixed Poisson process, allows the probability distribution of the random partitions of a subset of a sample to be dependent on the sample size, a distinct and motivated feature that differs it from a partition structure. A generalized negative binomial process model is proposed to generate a cluster structure, where in the prior the number of clusters is finite and Poisson distributed, and the cluster sizes follow a truncated negative binomial distribution. We construct a nonparametric Bayesian estimator of Simpson's index of diversity under the generalized negative binomial process. We illustrate our results through the analysis of two real sequencing count datasets.

研究动机与目标

  • 解决现有交换性划分模型在聚类概率函数中假设样本量独立性所带来的局限性。
  • 构建一种灵活的非参数贝叶斯框架,用于建模物种多样性,同时考虑物种丰度数据中的样本量效应。
  • 构建一种稳健的Simpson多样性指数估计器,相较于传统频率学估计,在小样本和高多样性情境下表现更优。
  • 实现在基因组学和免疫学中(如T细胞受体和EST测序数据集)从计数数据中准确推断物种均匀度。
  • 为贝叶斯非参数混合模型中随机计数向量和潜在计数矩阵的建模提供基础。

提出的方法

  • 提出一种基于完全随机测度混合泊松过程的聚类结构,使划分概率依赖于样本量。
  • 引入具有有限、泊松分布聚类数和截断负二项分布聚类大小的广义负二项分布过程(GNBP)。
  • 推导出一种交换性聚类概率函数(ECPF),通过引入样本量依赖性,推广了EPPF。
  • 基于GNBP先验,开发Simpson指数的非参数贝叶斯估计器,通过MCMC实现后验推断。
  • 应用类似中国餐馆过程的抽样规则,生成具有依赖于样本量的预测概率的划分。
  • 使用MCMC结合Gibbs抽样,估计参数(γ₀, a, p)的后验分布,并计算后验预测多样性估计。

实验结果

研究问题

  • RQ1能否构建一种物种模型,使得随机划分的分布显式依赖于样本量,而非如划分结构中那样保持不变?
  • RQ2如何设计一种非参数贝叶斯模型,以在小样本和高多样性情境下更准确地估计Simpson多样性指数?
  • RQ3与基于标准EPPF的模型相比,广义负二项分布过程在建模物种丰度频率计数方面的表现如何?
  • RQ4所提出的模型能否有效捕捉真实测序数据集(如T细胞受体和EST数据)中的物种均匀度?
  • RQ5允许折扣参数a被推断而非固定,对Simpson指数估计精度有何影响?

主要发现

  • 在EST数据模拟中,所提出的广义负二项分布过程模型若推断折扣参数a < 1,对真实Simpson指数的95%可信区间覆盖率为99%,50%可信区间覆盖率为69%。
  • 当a被限制在0 ≤ a < 1时,该方法的平均偏差为0.48 × 10⁻³,中位数偏差为1.11 × 10⁻³,显著优于固定a = 0.5或a = 0的情况。
  • 该模型在T细胞受体和EST数据集中均表现出优越性能,显示糖尿病小鼠调节性T细胞中Simpson指数更低,表明多样性减少。
  • 模拟研究显示,将a固定为-1或0时,50%和95%可信区间的覆盖率均为0%,凸显了允许a被推断的重要性。
  • 该模型通过引入样本量依赖性,显著提高了后验多样性估计的准确性,尤其在高多样性、低样本量的情境下。
  • 该框架支持高效的MCMC推断,并为贝叶斯非参数模型中随机计数矩阵和潜在聚类结构的建模提供了基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。