Skip to main content
QUICK REVIEW

[论文解读] Beyond Uniform Priors in Bayesian Network Structure Learning

Marco Scutari|arXiv (Cornell University)|Apr 12, 2017
Bayesian Modeling and Causal Inference参考文献 25被引用 3
一句话总结

本文提出使用贝叶斯狄里克雷稀疏(BDs)边际似然与边际均匀(MU)图先验,作为贝叶斯网络结构学习中标准均匀(U)+ BDeu评分的替代方案。实证结果表明,MU+BDs在小样本和稀疏数据集上显著提升了结构学习的准确性,同时保持了具有竞争力的预测性能,且计算成本未增加。

ABSTRACT

Bayesian network structure learning is often performed in a Bayesian setting, evaluating candidate structures using their posterior probabilities for a given data set. Score-based algorithms then use those posterior probabilities as an objective function and return the maximum a posteriori network as the learned model. For discrete Bayesian networks, the canonical choice for a posterior score is the Bayesian Dirichlet equivalent uniform (BDeu) marginal likelihood with a uniform (U) graph prior, which assumes a uniform prior both on the network structures and on the parameters of the networks. In this paper, we investigate the problems arising from these assumptions, focusing on those caused by small sample sizes and sparse data. We then propose an alternative posterior score: the Bayesian Dirichlet sparse (BDs) marginal likelihood with a marginal uniform (MU) graph prior. Like U+BDeu, MU+BDs does not require any prior information on the probabilistic structure of the data and can be used as a replacement noninformative score. We study its theoretical properties and we evaluate its performance in an extensive simulation study, showing that MU+BDs is both more accurate than U+BDeu in learning the structure of the network and competitive in predicting power, while not being computationally more complex to estimate.

研究动机与目标

  • 为解决标准U+BDeu评分在贝叶斯网络结构学习中,特别是在样本量较小和数据稀疏情况下的局限性。
  • 研究在离散贝叶斯网络中,对网络结构与参数均采用均匀先验时所存在的理论与实证缺陷。
  • 提出一种新的后验评分方法——结合MU先验的BDs,使其更符合稀疏数据特征,同时保持非信息性与计算高效性。
  • 在多种基准网络与数据条件下,评估该新评分在结构准确性与预测能力方面的表现。

提出的方法

  • 提出贝叶斯狄里克雷稀疏(BDs)边际似然作为BDeu评分的非信息性替代方案,通过偏好稀疏条件概率表,更好地处理稀疏数据。
  • 引入边际均匀(MU)图先验,为所有DAG分配均匀概率,保持非信息性特性,同时避免标准均匀先验带来的结构偏差。
  • 推导MU+BDs评分的理论性质,包括在稀疏数据条件下的相合性与渐近行为。
  • 在10个基准贝叶斯网络(如Alarm、Hailfinder、Hepar2)上开展全面的模拟研究,覆盖不同的样本量与变量数比(n/p = 0.1、0.2、0.5)。
  • 使用结构汉明距离(SHD)衡量恢复真实DAG的准确性,使用预测对数似然评估模型性能。
  • 在多种指标下比较MU+BDs与U+BDeu及其他MU先验变体的表现,包括平均SHD与预测对数似然。

实验结果

研究问题

  • RQ1当数据量小且稀疏时,对DAG与参数采用均匀先验如何影响结构学习的准确性?
  • RQ2在数据稀缺条件下,结合MU图先验的BDs边际似然是否能生成比U+BDeu更准确的网络结构?
  • RQ3与U+BDeu相比,所提出的MU+BDs评分在预测性能上是否具有竞争力?
  • RQ4尽管具备更优的理论性质,该新评分是否仍保持计算效率?
  • RQ5MU+BDs在不同网络拓扑结构与数据模式(如n/p = 0.1与n/p = 0.5)下的表现如何?

主要发现

  • 在所有基准网络中,当样本量较小时(n/p = 0.1与0.2),MU+BDs的结构汉明距离(SHD)显著低于U+BDeu,表明其结构学习准确性更优。
  • 在Hailfinder网络中,当n/p = 0.1时,MU+BDs将SHD从5.31(U+BDeu)降低至4.20,降幅达1.11,其中表现最佳的MU变体(c=5)达到4.20的SHD。
  • 在Hepar2网络中,当n/p = 0.1时,MU+BDs将SHD从3.73(U+BDeu)降至3.41(最佳MU变体),提升达8.6%。
  • 在预测性能方面,MU+BDs在对数似然上始终与U+BDeu相当或略优;在n/p = 0.5时,其最佳变体(c=5)在Hepar2上达到3.30的对数似然,与U+BDeu的3.31相比几乎持平。
  • MU+BDs评分保持了计算效率,其估计复杂度与U+BDeu相比未增加,因此适用于大规模应用。
  • 模拟结果表明,MU+BDs在多种网络结构中均表现稳健,涵盖稀疏网络(如Water)与复杂网络(如Alarm),在所有测试数据模式下均表现优异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。