Skip to main content
QUICK REVIEW

[论文解读] Bayesian two-sample tests

Karsten Borgwardt, Zoubin Ghahramani|ArXiv.org|Jun 22, 2009
Bayesian Methods and Mixture Models参考文献 20被引用 13
一句话总结

本文提出了两种贝叶斯两样本检验方法:一种是针对指数族分布的参数化方法,另一种是使用狄利克雷过程混合模型(DPMs)的非参数方法,以灵活建模未知分布。该方法通过边缘似然计算贝叶斯因子,避免了自助法(bootstrapping),并通过贝叶斯层次聚类等近似方法实现高效推断,为频率学派检验提供了一种原理严谨、通用性强的替代方案。

ABSTRACT

In this paper, we present two classes of Bayesian approaches to the two-sample problem. Our first class of methods extends the Bayesian t-test to include all parametric models in the exponential family and their conjugate priors. Our second class of methods uses Dirichlet process mixtures (DPM) of such conjugate-exponential distributions as flexible nonparametric priors over the unknown distributions.

研究动机与目标

  • 开发一种通用的贝叶斯两样本框架,避免依赖特定应用的假设。
  • 将贝叶斯t检验从高斯模型扩展至所有具有共轭先验的指数族分布。
  • 提出一种基于狄利克雷过程混合模型(DPMs)的非参数贝叶斯方法,灵活建模未知分布。
  • 在DPM先验下,通过边缘似然计算模型比较的贝叶斯因子,以区分相等与不同的分布。
  • 通过利用贝叶斯层次聚类(BHC)等近似方法,实现高效推断,将计算成本降低至O(n²)以下。

提出的方法

  • 提出一种基于指数族分布与共轭先验的参数化贝叶斯两样本检验方法,推广了贝叶斯t检验。
  • 采用狄利克雷过程混合模型(DPMs)作为未知分布q₁和q₂的非参数先验,实现对复杂数据的灵活建模。
  • 通过DPM先验下对所有参数的积分,计算贝叶斯因子χ,其定义为P(X|α,β)P(Y|α,β) / P(X,Y|α,β)。
  • 利用边缘似然表达式p(D|α,β) = ∑_{v∈V} p(v|α)p(D|v,β),其中V为所有数据划分的集合,以计算DPM下的证据。
  • 应用贝叶斯层次聚类(BHC)对DPM下的边缘概率进行近似推断,实现中等规模n下的O(n²)运行时间。
  • 利用分量参数的共轭先验和混合权重的狄利克雷先验,确保边缘似然的可计算性。

实验结果

研究问题

  • RQ1如何将贝叶斯t检验从高斯假设推广至所有指数族分布?
  • RQ2狄利克雷过程混合模型能否为两样本问题中未知分布的建模提供灵活且非参数的先验?
  • RQ3如何高效计算DPM先验下的边缘似然,以支持贝叶斯因子的计算?
  • RQ4与需要自助法的频率学派方法相比,所提出的贝叶斯两样本检验在计算效率上表现如何?
  • RQ5像贝叶斯层次聚类这样的近似推断方法能否为真实世界数据提供准确且可扩展的贝叶斯因子?

主要发现

  • 参数化贝叶斯两样本检验将贝叶斯t检验推广至所有指数族分布,使其适用范围超越正态性假设。
  • 基于DPM的非参数检验方法无需假设分布的参数形式,即可灵活建模未知分布,为参数假设提供了稳健的替代方案。
  • 贝叶斯因子计算为χ = P(X|α,β)P(Y|α,β) / P(X,Y|α,β),其边缘似然通过数据配置的划分求和方式推导得出。
  • 通过贝叶斯层次聚类(BHC)进行近似推断,可实现O(n²)的边缘概率计算,使该方法在中等规模数据集上具备可扩展性。
  • 该贝叶斯方法避免了通过自助法估计零分布的需求,为频率学派两样本检验提供了一种计算更高效的替代方案。
  • 该方法为两样本问题提供了一种原理严谨、通用性强的解决方案,兼具统计严谨性与通过近似技术实现的计算可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。