Skip to main content
QUICK REVIEW

[论文解读] Efficient Probabilistic Inference in the Quest for Physics Beyond the Standard Model

Atılım Güneş Baydin, L. Heinrich|arXiv (Cornell University)|Jul 20, 2018
Scientific Computing and Data Management被引用 7
一句话总结

本文提出了一种跨平台的概率执行协议,使通用推理引擎能够将大规模科学模拟器(如粒子物理中的SHERPA)作为概率程序进行控制,从而通过使用深度循环网络进行推理编译,实现高效且可解释的贝叶斯推断。该方法在计算成本仅为传统方法几分之一的情况下,达到了接近马尔可夫链蒙特卡洛(MCMC)的精度,已在具有复杂探测器响应的底子衰变模拟中得到验证。

ABSTRACT

We present a novel probabilistic programming framework that couples directly to existing large-scale simulators through a cross-platform probabilistic execution protocol, which allows general-purpose inference engines to record and control random number draws within simulators in a language-agnostic way. The execution of existing simulators as probabilistic programs enables highly interpretable posterior inference in the structured model defined by the simulator code base. We demonstrate the technique in particle physics, on a scientifically accurate simulation of the tau lepton decay, which is a key ingredient in establishing the properties of the Higgs boson. Inference efficiency is achieved via inference compilation where a deep recurrent neural network is trained to parameterize proposal distributions and control the stochastic simulator in a sequential importance sampling scheme, at a fraction of the computational cost of a Markov chain Monte Carlo baseline.

研究动机与目标

  • 实现对非可微且似然不可计算的大规模科学模拟器(如粒子物理中使用的模拟器)的概率推断。
  • 通过创建一种跨平台、语言无关的接口,弥合领域特定模拟器与通用概率编程之间的鸿沟,以控制随机数生成。
  • 在无需重新实现模型的前提下,将贝叶斯推断扩展至具有复杂高维潜在空间的模拟器(如粒子衰变和探测器响应的建模)。
  • 证明通过深度神经网络进行推理编译,学习序列重要性采样提议分布,实现推理成本分摊的可行性。
  • 实现在大规模真实物理模拟中可解释的后验推断,为超越标准模型的新物理发现铺平道路。

提出的方法

  • 设计了一种跨平台的概率执行协议,通过使用FlatBuffers进行序列化,以语言无关的方式拦截并管理随机数抽取,使推理引擎能够控制模拟器。
  • 通过仅需极少代码修改的封装方式,将现有模拟器(如SHERPA)集成为概率程序,保留其原始功能的同时暴露随机控制接口。
  • 采用推理编译:训练一个长短期记忆(LSTM)网络以预测序列重要性采样的提议分布,从而减少被拒绝的样本数量。
  • 推理引擎使用重要性加权(公式3)校正有偏的提议,确保收敛至真实后验分布。
  • 采用3D-CNN–LSTM架构处理探测器级别的观测数据,并生成上下文感知的提议分布,训练基于来自先验分布的300万条模拟轨迹。
  • 支持分布式训练与推理,可在20个计算节点上实现可扩展执行,训练一个含1.43亿参数的神经网络,历时40个周期。

实验结果

研究问题

  • RQ1能否构建一个通用的概率编程框架,在不修改其源代码的前提下,与大规模领域特定模拟器进行交互?
  • RQ2使用深度神经网络进行推理编译,能否显著降低似然不可计算的模拟器中后验推断的计算成本?
  • RQ3该框架能否在高维复杂物理模型中,以远低于传统方法的成本,实现与马尔可夫链蒙特卡洛相当的后验精度?
  • RQ4学习得到的提议分布在处理潜在空间中的罕见或低概率事件(如具有复杂探测器特征的罕见底子衰变)时表现如何?
  • RQ5该框架能否实现可解释的、基于模型的机器学习,使得后验样本能直接对应模拟器中的可识别物理过程?

主要发现

  • 该框架成功将SHERPA事件生成器与Geant4探测器模拟器集成至概率编程流水线中,实现了对100万行代码库的完整贝叶斯推断,且仅需极少修改。
  • 采用基于LSTM的提议网络进行推理编译,将推断成本降低至基线MCMC方法的10%以下,同时达到近乎相同的后验精度。
  • 该方法准确捕捉到了罕见底子衰变(τ → ντK⁻K⁻K⁺)在通道22上的低概率后验质量,其中训练期间的先验膨胀显著提升了提议质量。
  • 后验分布高度可解释,推断参数与模拟器中的物理过程(如衰变分支比和探测器响应)之间存在清晰对应关系。
  • 训练好的推理神经网络实现了成本分摊推断,单个预训练模型可支持对新观测的重复、快速推断而无需重新训练。
  • 该方法在复杂高维模型中表现出可扩展性,推断过程中遇到约24,000个不同的潜在地址,证实了其在大规模场景下的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。