[论文解读] Cluster Variational Approximations for Structure Learning of Continuous-Time Bayesian Networks from Incomplete Data
该论文提出了一种新颖的簇变分推断方法,用于从不完整且含噪声的时间序列数据中实现连续时间贝叶斯网络(CTBNs)的可扩展结构学习。通过解析推导可边际化的动力学(基于常微分方程)并利用变分自由能近似结构得分,该方法实现了高效且准确的图结构重建——在合成数据和真实生物网络(包括一个14节点网络)上进行了验证,其在可扩展性和准确性方面优于现有的采样方法和变分基线方法。
Continuous-time Bayesian networks (CTBNs) constitute a general and powerful framework for modeling continuous-time stochastic processes on networks. This makes them particularly attractive for learning the directed structures among interacting entities. However, if the available data is incomplete, one needs to simulate the prohibitively complex CTBN dynamics. Existing approximation techniques, such as sampling and low-order variational methods, either scale unfavorably in system size, or are unsatisfactory in terms of accuracy. Inspired by recent advances in statistical physics, we present a new approximation scheme based on cluster-variational methods significantly improving upon existing variational approximations. We can analytically marginalize the parameters of the approximate CTBN, as these are of secondary importance for structure learning. This recovers a scalable scheme for direct structure learning from incomplete and noisy time-series data. Our approach outperforms existing methods in terms of scalability.
研究动机与目标
- 解决在数据不完整且含噪声时,学习连续时间贝叶斯网络中定向网络结构的挑战。
- 克服现有采样方法和低阶变分方法在高维CTBN中可扩展性和准确性方面的局限性。
- 开发一种直接的结构学习框架,通过利用簇变分方法避免昂贵的隐状态估计。
- 通过边际化变分自由能,推导出结构得分的闭式近似,以实现高效的贪心优化。
- 实现从观测次数有限的真实世界时间序列数据中,对复杂生物网络(如基因调控网络)的准确重建。
提出的方法
- 该方法采用统计物理中的簇变分近似,构建对不可靠的隐CTBN状态后验分布的一致且可处理的近似。
- 将CTBN的边际动力学表述为一组仅依赖于观测数据、先验假设和图结构的常微分方程(ODE),从而实现高效模拟。
- 对模型参数进行变分自由能的边际化,从而实现无需参数估计的结构得分的直接优化。
- 从边际化变分能量中推导出结构得分的近似,该近似作为贪心结构学习中模型证据的代理。
- 算法使用爬山法程序识别得分最高的图,其依据是近似的结构得分。
- 该方法使用标准的ODE求解器实现,确保计算效率,并可扩展至更大规模的网络。
实验结果
研究问题
- RQ1簇变分方法能否提升在不完整数据下的连续时间贝叶斯网络结构学习的准确性和可扩展性?
- RQ2如何解析推导CTBN的边际动力学,并在不进行采样的情况下用于近似完整后验?
- RQ3在多大程度上可对参数进行变分自由能的边际化,以实现直接的结构学习?
- RQ4与基于采样的方法和低阶变分方法相比,该方法在结构重建准确性和计算成本方面表现如何?
- RQ5该方法能否成功地从含噪声且不完整的时序数据中重建大规模生物网络(如基因调控网络)?
主要发现
- 该方法成功从不完整且含噪声的数据中重建了包含14个节点的CTBN(含叶到根的反馈),其规模超过以往文献中使用基于采样的方法所报告的11个节点网络。
- 在N=5个节点、k_max=1的合成数据上,当数据充足时,该方法在图恢复方面表现出高准确性,显示出对噪声的鲁棒性。
- 当k_max=2时,性能下降,这是由于模型复杂度增加以及更密集连接图中的强相关性所致,表明模型表达能力与可识别性之间存在权衡。
- 在IRMA酿酒酵母基因调控网络上,该方法在PPV和SE指标上表现具有竞争力,其PPV在“开启”和“关闭”数据集上均优于BANJO,并与TSNI持平或更优。
- 与现有采样和变分基线相比,该方法在可扩展性方面表现更优,能够高效实现高维系统中的结构学习。
- 推导出的基于ODE的动力学为真实潜在过程提供了稳定且准确的近似,从而在无需完整后验采样的情况下实现了可靠的结构推断。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。