Skip to main content
QUICK REVIEW

[论文解读] Quantifying the probable approximation error of probabilistic inference programs

Marco Cusumano-Towner, Vikash K. Mansinghka|arXiv (Cornell University)|May 31, 2016
Machine Learning and Algorithms参考文献 16被引用 3
一句话总结

本文提出一种主观分歧度量方法,通过利用参考推理程序和元推理程序来量化概率推理程序中的近似误差,其中元推理程序用于推断近似推理方法可能的内部随机选择。该方法为对称KL分歧提供了稳健且可计算的上界,并能在预测性能看似可接受时检测出实现中的错误。

ABSTRACT

This paper introduces a new technique for quantifying the approximation error of a broad class of probabilistic inference programs, including ones based on both variational and Monte Carlo approaches. The key idea is to derive a subjective bound on the symmetrized KL divergence between the distribution achieved by an approximate inference program and its true target distribution. The bound's validity (and subjectivity) rests on the accuracy of two auxiliary probabilistic programs: (i) a "reference" inference program that defines a gold standard of accuracy and (ii) a "meta-inference" program that answers the question "what internal random choices did the original approximate inference program probably make given that it produced a particular result?" The paper includes empirical results on inference problems drawn from linear regression, Dirichlet process mixture modeling, HMMs, and Bayesian networks. The experiments show that the technique is robust to the quality of the reference inference program and that it can detect implementation bugs that are not apparent from predictive performance.

研究动机与目标

  • 解决在概率推理中估计近似后验与真实后验之间Kullback-Leibler(KL)分歧的可计算技术缺乏的问题。
  • 提供一种实用的、主观的对称KL分歧上界,该上界反映对辅助程序准确性的不确定性,而非客观模型属性。
  • 检测那些不影响预测性能但会扭曲后验近似的推理程序中的细微实现错误。
  • 实现对多种模型中推理程序的验证,包括变分推理和蒙特卡洛方法。
  • 在Venture概率编程平台内提供一种可扩展且可直接实现的技术。

提出的方法

  • 该方法基于近似推理输出与真实后验之间的对称KL分歧,定义了一种主观分歧度量。
  • 其依赖于一个参考推理程序,该程序作为后验准确性的黄金标准,即使计算成本较高。
  • 使用元推理程序来估计在给定近似推理程序输出的前提下,其内部随机选择的后验概率。
  • 该技术通过近似推理程序的输出及其推断历史的联合密度与提议密度之比,计算权重估计。
  • 对于基于粒子滤波的推理,元推理程序使用固定谱系的条件SMC(CSMC)更新,以估计推理路径的可能性。
  • 最终的权重估计简化为粒子滤波的边际似然估计与模型密度和提议密度归一化比值的乘积。

实验结果

研究问题

  • RQ1能否推导出一种主观分歧度量,以界定近似推理程序输出与真实后验之间对称KL分歧的上界?
  • RQ2当参考推理程序存在不准确时,该方法的鲁棒性如何?
  • RQ3该方法能否检测出仅通过预测性能无法察觉的推理代码实现错误?
  • RQ4当近似推理程序缺乏可计算密度时,该技术是否依然有效?
  • RQ5该方法在不同推理范式(如变分推理和基于粒子的采样)中的可扩展性如何?

主要发现

  • 该方法提供了对称KL分歧的有效主观上界,其依赖于对参考程序和元推理程序准确性的信念。
  • 实验结果表明,该方法对参考推理程序的质量具有鲁棒性,即使参考程序本身是近似的,也能获得准确的分歧估计。
  • 该技术成功检测出那些未降低保留数据上预测性能的推理代码实现错误。
  • 对于基于采样的推理(如LW-SIR),该方法在自举置信区间显示低方差的情况下,实现了准确的主观分歧估计。
  • 在基于优化的推理(如变分推理)中,该方法在多次运行中产生了稳定的分歧轮廓,表明其误差量化具有可靠性。
  • 该方法已在真实世界问题中成功实现并验证,包括线性回归、狄利克雷过程混合模型、HMM和贝叶斯网络。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。