Skip to main content
QUICK REVIEW

[论文解读] Coupling optional Pólya trees and the two sample problem

Li Ma, Wing Hung Wong|arXiv (Cornell University)|Nov 4, 2010
Bayesian Methods and Mixture Models被引用 7
一句话总结

本文提出耦合可选Pólya树(co-OPT)先验,一种贝叶斯非参数方法,通过允许两个概率分布‘耦合’——即在样本空间的子集上共享相同的条件分布——联合建模两个分布。该方法在高维设置下通过数据自适应划分和MCMC推断的计算效率提升,优于经典检验,实现了两样本差异的假设检验与差异结构表征,显著提升检验效能。

ABSTRACT

Testing and characterizing the difference between two data samples is of fundamental interest in statistics. Existing methods such as Kolmogorov-Smirnov and Cramer-von-Mises tests do not scale well as the dimensionality increases and provides no easy way to characterize the difference should it exist. In this work, we propose a theoretical framework for inference that addresses these challenges in the form of a prior for Bayesian nonparametric analysis. The new prior is constructed based on a random-partition-and-assignment procedure similar to the one that defines the standard optional Pólya tree distribution, but has the ability to generate multiple random distributions jointly. These random probability distributions are allowed to "couple", that is to have the same conditional distribution, on subsets of the sample space. We show that this "coupling optional Pólya tree" prior provides a convenient and effective way for both the testing of two sample difference and the learning of the underlying structure of the difference. In addition, we discuss some practical issues in the computational implementation of this prior and provide several numerical examples to demonstrate its work.

研究动机与目标

  • 为解决Kolmogorov-Smirnov和Cramer-von-Mises等经典两样本检验在高维设置下效能下降且丧失结构可解释性的问题。
  • 开发一种贝叶斯非参数框架,联合建模两个分布,同时允许其在样本空间的共享区域上耦合,从而增强检验效能与可解释性。
  • 提供一种不仅可检验分布差异,还能学习此类差异潜在结构(如哪些变量或空间区域导致差异)的方法。
  • 通过递归随机分割实现数据驱动的样本空间划分,克服非参数两样本推断中的维度灾难问题。
  • 通过MCMC算法实现实际应用,采用高效的吉布斯采样方案对关键参数(如耦合概率 $\epsilon$)进行后验推断。

提出的方法

  • co-OPT先验通过引入联合随机划分与分配机制,扩展了可选Pólya树(OPT),使两个分布能在共享子区域上共享条件分布,实现耦合。
  • 该方法采用层次先验结构,其中两个分布建模为 $Q_1 = \epsilon H_0 + (1-\epsilon)H_1$ 和 $Q_2 = \epsilon H_0 + (1-\epsilon)H_2$,其中 $H_0, H_1, H_2$ 独立同分布于狄利克雷分布,且 $\epsilon \sim Beta(a_\epsilon, b_\epsilon)$。
  • 采用吉布斯采样器,迭代更新隐式指标 $J_j^i$(将每个观测分配至 $H_0$ 或 $H_i$)、混合比例 $\epsilon$,以及基分布 $H_0, H_1, H_2$,使用共轭后验更新。
  • 后验推断聚焦于 $\epsilon$ 的期望值,从MCMC样本中估计,该值量化了两个样本之间共享结构的程度。
  • 通过递归分割实现数据自适应划分,划分过程由数据引导,以降低维度并提升稀疏区域的估计性能。
  • 该框架扩展至连续与离散设置,针对多元正态混合模型与列联表提供了具体实现,采用共轭先验与高效采样方案。

实验结果

研究问题

  • RQ1能否构建一种贝叶斯非参数先验,实现对两个概率分布的联合建模,同时允许其在样本空间的共享区域上耦合?
  • RQ2与经典非参数检验相比,co-OPT先验是否在高维设置下提升了两样本差异的检验效能?
  • RQ3co-OPT框架能否有效识别并表征分布差异的结构成分,如哪些变量或区域导致差异?
  • RQ4如何为co-OPT先验实现高效的MCMC推断,特别是对隐式分配指标与超参数的采样?
  • RQ5将基狄利克雷先验的支持限制在观测到的列联表单元上,在稀疏高维列联表问题中在多大程度上提升了检验效能?

主要发现

  • co-OPT先验成功实现了两个分布的耦合联合建模,在经典检验失效的高维设置下显著提升了差异检测能力。
  • 从10,000次MCMC采样(预 burn-in 步骤为10,000)中估计的 $\epsilon$ 后验均值,成为两个样本相似性的稳健度量,接近0的值表示显著差异。
  • 在列联表示例中,将狄利克雷先验支持限制在仅观测到的单元上,显著提升了统计效能,因有效缓解了稀疏性影响。
  • 针对 $\epsilon$、$J_j^i$、$H_0$、$H_1$ 和 $H_2$ 的吉布斯采样器收敛高效,后验更新基于共轭分布,支持实际应用。
  • 该方法优于标准非参数检验,不仅提供类似p值的推断,还提供可解释的结构信息,如哪些变量或区域驱动了差异。
  • 该框架具有灵活性,适用于连续数据(如正态混合模型)与离散数据(如列联表),在数值示例中表现一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。