[论文解读] Variational Message Passing with Structured Inference Networks
本文提出了一种变分消息传递算法,统一了结构化推理网络、摊销推理与自然梯度更新,适用于混合深度概率模型。通过设计与图模型结构相匹配的推理网络,该方法实现了快速、可扩展且高效的推理,同时保持了可解释性,并在合成数据集和真实世界数据集上均优于先前方法。
Recent efforts on combining deep models with probabilistic graphical models are promising in providing flexible models that are also easy to interpret. We propose a variational message-passing algorithm for variational inference in such models. We make three contributions. First, we propose structured inference networks that incorporate the structure of the graphical model in the inference network of variational auto-encoders (VAE). Second, we establish conditions under which such inference networks enable fast amortized inference similar to VAE. Finally, we derive a variational message passing algorithm to perform efficient natural-gradient inference while retaining the efficiency of the amortized inference. By simultaneously enabling structured, amortized, and natural-gradient inference for deep structured models, our method simplifies and generalizes existing methods.
研究动机与目标
- 解决结合深度学习与概率图模型(PGMs)以构建灵活且可解释模型的挑战。
- 克服现有推理算法的局限性,这些算法要么依赖随机梯度方法(深度学习中常见),要么依赖共轭指数族(PGMs中常见)。
- 开发一种统一的推理框架,使单一算法能够同时支持摊销化、结构化与自然梯度更新。
- 通过推导结构化推理网络支持快速摊销推理的条件,简化并推广先前工作,特别是Johnson等人(2016)的研究。
- 通过在结构化推理网络中使用共轭近似,实现对非共轭因子模型的有效推理。
提出的方法
- 提出结构化推理网络(SINs),将图模型结构嵌入变分自编码器(VAEs)的推理网络架构中,模仿生成模型的条件依赖关系。
- 推导出两个充分条件,使SINs能够支持快速摊销推理,类似于标准VAEs,通过确保变分后验与模型的条件独立结构一致地因子分解。
- 整合Khan与Lin(2017)提出的最新VMP方法,推导出一种消息传递算法,可自动计算深层网络组件的随机梯度与PGM组件的自然梯度更新。
- 对PGM部分使用自然梯度更新以提升收敛性与稳定性,同时保持深层组件摊销推理的效率。
- 将所得的SAN(结构化、摊销化、自然梯度)算法应用于结合深层网络与PGMs的混合模型,如高斯混合模型与状态空间模型。
- 通过在推理网络中使用共轭高斯近似,证明该方法对非共轭因子(如学生t分布)具有鲁棒性,可有效推断具有学生t分布因子的模型。
实验结果
研究问题
- RQ1是否可以设计结构化推理网络,使混合深度结构化模型中的摊销推理如同标准VAEs一样实现?
- RQ2在结合深层网络与PGMs的模型中,结构化推理网络在何种条件下能保持摊销推理的效率?
- RQ3能否在单一算法中统一支持此类混合模型中的结构化、摊销化与自然梯度更新?
- RQ4当在推理网络中使用共轭近似时,该方法在具有非共轭因子(如学生t分布)的模型中表现如何?
- RQ5SAN算法是否在性能上优于或至少可与SVAE等先前最先进方法相媲美,同时简化推理框架?
主要发现
- 在Pinwheel与Auto数据集上,SAN算法的训练收敛速度优于SVAE,且在收敛后性能相当。
- 在Pinwheel数据集上,基于潜在高斯混合模型(GMM)与潜在学生t分布混合模型(TMM)的SAN优于GMM,且对异常值具有鲁棒性,TMM在70%异常值水平下仍保持性能。
- 当70%的Pinwheel数据被高方差高斯噪声污染时,基于潜在TMM的SAN模型在测试MSE上显著优于仅在10%异常值下训练的GMM-SAN模型。
- VAE因缺乏显式的聚类机制,无法学习可解释的聚类,而SAN成功学习到有意义且语义一致的聚类,如生成样本所示。
- 该方法可推广至非共轭模型:即使真实模型包含非共轭因子(如学生t分布),共轭SIN仍能提供有效推理并提升鲁棒性。
- SAN算法的实现已发布于GitHub,支持可复现性与框架的进一步扩展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。