Skip to main content
QUICK REVIEW

[论文解读] Algebraic Bayesian analysis of contingency tables with possibly zero-probability cells

Guido Consonni, Giovanni Pistone|ArXiv.org|Mar 5, 2007
Bayesian Modeling and Causal Inference参考文献 22被引用 7
一句话总结

本文提出了一种代数贝叶斯框架,用于列联表分析,通过将零概率单元格(包括结构性零和可能的零计数单元格)作为混合模型中的不同模型实例进行显式建模。利用计算代数几何,该方法枚举了所有可能的支持集,为每个模型实例分配先验,并通过狄利克雷分布推导出相容先验,从而在存在零概率单元格时,得到的贝叶斯因子与标准对数线性模型存在显著差异。

ABSTRACT

In this paper we consider a Bayesian analysis of contingency tables allowing for the possibility that cells may have probability zero. In this sense we depart from standard log-linear modeling that implicitly assumes a positivity constraint. Our approach leads us to consider mixture models for contingency tables, where the components of the mixture, which we call model-instances, have distinct support. We rely on ideas from polynomial algebra in order to identify the various model instances. We also provide a method to assign prior probabilities to each instance of the model, as well as describing methods for constructing priors on the parameter space of each instance. We illustrate our methodology through a $5 imes 2$ table involving two structural zeros, as well as a zero count. The results we obtain show that our analysis may lead to conclusions that are substantively different from those that would obtain in a standard framework, wherein the possibility of zero-probability cells is not explicitly accounted for.

研究动机与目标

  • 解决标准对数线性模型假设单元格概率严格为正所带来的局限性,因为这可能掩盖实质性建模洞察。
  • 开发一种贝叶斯框架,显式考虑列联表中的结构性零和可能的零概率单元格。
  • 利用代数统计方法枚举并表征具有不同支持集的所有可能模型实例,从而实现更全面的模型空间。
  • 为每个模型实例提供一种系统的方法来分配先验概率,并推导其参数空间上的相容先验。
  • 证明当零概率单元格未被显式建模时,标准贝叶斯分析可能得出误导性结论,尤其是在稀疏或结构受限的列联表中。

提出的方法

  • 使用多项式代数和计算代数几何,识别所有不同的模型实例(即支持受限的对数线性模型),对应于不同组合的零概率单元格。
  • 为单元格计数的抽样分布构建一个混合模型,其中每个分量对应一个具有特定支持集的不同模型实例。
  • 在单纯形上使用狄利克雷先验,并通过引理1应用边缘化和条件化规则,推导出每个模型实例参数空间上的相容先验。
  • 基于结构和实质性考虑,为每个模型实例分配先验概率,从而通过贝叶斯因子实现模型比较。
  • 使用符号计算工具(如 CoCoA)实现该方法,以枚举支持集并计算边际似然。
  • 通过在混合框架下计算竞争模型(例如,准独立模型与结构性零模型)的边际似然,构建用于模型比较的贝叶斯因子。

实验结果

研究问题

  • RQ1当某些单元格被约束为零概率时,如何系统地枚举对数线性模型的所有可能模型实例?
  • RQ2在考虑零概率单元格的贝叶斯框架中,如何为不同模型实例提供一种系统的方法来分配先验概率?
  • RQ3当零概率单元格被显式建模与被忽略或移除时,所得的贝叶斯因子有何不同?
  • RQ4包含结构性零和零计数单元格对列联表中准独立性推断有何影响?
  • RQ5代数统计与计算工具能否与贝叶斯方法有效结合,以改善稀疏或高维列联表中的模型选择?

主要发现

  • 所提出的方法利用代数几何识别出多个具有不同支持集的模型实例,从而比标准对数线性模型提供了更全面的模型空间表示。
  • 对于一个具有两个结构性零和一个零计数的 $5 \times 2$ 列联表,混合模型下的贝叶斯因子为 0.55,表明对准独立性模型的证据微弱。
  • 相比之下,忽略零概率单元格的标准贝叶斯分析得到的贝叶斯因子为 0.17,对应于杰弗里斯尺度上更强的对准独立性模型的证据。
  • 对数贝叶斯因子(log₁₀(1/0.55) ≈ 0.26)表明对准独立性模型的证据仅为“较差”,其极端程度比标准分析低一个数量级。
  • 结果表明,当零概率单元格未被显式建模时,标准模型可能夸大对某一假设的反对证据,从而导致实质性不同的结论。
  • 该方法提供了一个连贯的先验设定与模型比较框架,充分尊重模型空间的几何与组合结构,尤其通过狄利克雷先验的条件化与边缘化实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。