[论文解读] Separate Exchangeability as Modeling Principle in Bayesian Nonparametrics
本文主张将独立交换性作为贝叶斯非参数模型中的基础建模原则,尤其适用于具有不同实验单元(如患者和蛋白质或OTU)的数据。它提出了两种新型模型——用于微生物组数据的嵌套随机划分模型,以及用于蛋白质激活的BNP回归模型(含加法随机效应),证明了独立交换性能够保持单元身份,并实现比部分交换性或联合交换性更准确、更具可解释性的推断。
We argue for the use of separate exchangeability as a modeling principle in Bayesian nonparametric (BNP) inference. Separate exchangeability is de facto widely applied in the Bayesian parametric case, e.g., it naturally arises in simple mixed models. However, while in some areas, such as random graphs, separate and (closely related) joint exchangeable models are widely used, they are curiously underused for several other applications in BNP. We briefly review the definition of separate exchangeability, focusing on the implications of such a definition in Bayesian modeling. We then discuss two tractable classes of models that implement separate exchangeability, which are the natural counterparts of familiar partially exchangeable BNP models. The first is nested random partitions for a data matrix, defining a partition of columns and nested partitions of rows, nested within column clusters. Many recent models for nested partitions implement partially exchangeable models related to variations of the well-known nested Dirichlet process. We argue that inference under such models in some cases ignores important features of the experimental setup. We obtain the separately exchangeable counterpart of such partially exchangeable partition structures. The second class is about setting up separately exchangeable priors for a nonparametric regression model when multiple sets of experimental units are involved. We highlight how a Dirichlet process mixture of linear models, known as ANOVA DDP, can naturally implement separate exchangeability in such regression problems. Finally, we illustrate how to perform inference under such models in two real data examples.
研究动机与目标
- 解决尽管独立交换性在多类型实验单元的模型中具有天然契合性,但在非参数贝叶斯模型中仍被低估使用的问题。
- 开发能够保留数据矩阵中行与列身份的模型(如患者与OTU或蛋白质之间),这些身份在部分或联合交换性下会丢失。
- 通过在不同类型的实验单元之间建模依赖关系,同时保持其独立角色,实现更准确的推断与预测。
- 为非参数模型中的独立交换性提供可推广的框架,适用于嵌套划分和加法随机效应结构。
- 通过两个真实数据应用证明,与替代交换性假设相比,独立交换性能够提供更好的模型拟合度和更可解释的结果。
提出的方法
- 提出一种嵌套随机划分模型,其中列聚类诱导出嵌套的行划分,从而保持行与列单元之间的区别。
- 使用基于狄利克雷过程的随机划分先验,以在每个列聚类内诱导行之间的依赖聚类,实现灵活且非参数化的聚类。
- 开发一种具有加法随机效应的贝叶斯非参数回归模型:一个用于患者/条件,另一个用于蛋白质/OTU,以确保独立交换性。
- 采用分层先验结构,使每类单元的随机效应从同一分布中抽取,从而在保持单元身份的同时实现信息共享。
- 使用基于MCMC的后验推断,通过吉布斯抽样更新划分和参数,包括后验预测检验和残差诊断。
- 使用模型拟合诊断方法,如残差的Q-Q图和R²,以验证模型性能并评估拟合优度。
实验结果
研究问题
- RQ1如何在非参数贝叶斯模型中正式定义并应用独立交换性,以更好地反映具有不同类型实验单元的实验设计?
- RQ2在具有层次或嵌套结构的数据矩阵建模中,独立交换性相较于部分或联合交换性在推断方面有何改进?
- RQ3独立交换性能否在非参数模型中有效应用于微生物组数据和蛋白质激活研究,以保持单元身份并实现准确预测?
- RQ4独立交换性对建模一种单元类型(如患者)的子集在另一类单元(如OTU或蛋白质)的不同聚类之间共享依赖关系有何影响?
- RQ5在真实世界生物数据集中,基于独立交换性的模型与基于部分交换性的模型在拟合度和可解释性方面有何比较?
主要发现
- 所提出的用于微生物组数据的独立交换性模型在模拟中成功恢复了真实聚类结构,前100个蛋白质中无误分类。
- 具有加法随机效应的BNP回归模型在各聚类中的平均R²为0.70(标准误0.075),表明模型拟合度良好。
- 残差Q-Q图未显示模型拟合度的证据不足,残差近似服从正态分布。
- 按斜率绝对差值(|γi|)排序的后验排名正确识别出表达随时间变化最大的前20个蛋白质。
- 该模型保留了实验单元的身份(如患者与蛋白质),从而能够生成在部分交换性下不可能实现的有意义汇总结果。
- 独立交换性相比联合交换性或部分交换性,能更忠实地反映实验设计,尤其是涉及块内共享单元的设计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。