[论文解读] Bayesian model comparison for simulation-based inference
本文提出了一种灵活、采样器无关的方法,用于在模拟推断(SBI)中使用学习到的调和平均估计器(harmonic)计算贝叶斯模型证据,仅需后验样本。该方法可在所有主要SBI框架——神经后验估计(NPE)、神经似然估计(NLE)和神经比值估计(NRE)中实现可靠的模型比较,其中NLE展现出更高的准确性,经与基于似然的嵌套采样方法对比验证。
Comparison of appropriate models to describe observational data is a fundamental task of science. The Bayesian model evidence, or marginal likelihood, is a computationally challenging, yet crucial, quantity to estimate to perform Bayesian model comparison. We introduce a methodology to compute the Bayesian model evidence in simulation-based inference (SBI) scenarios (also often called likelihood-free inference). In particular, we leverage the recently proposed learnt harmonic mean estimator and exploit the fact that it is decoupled from the method used to generate posterior samples, i.e. it requires posterior samples only, which may be generated by any approach. This flexibility, which is lacking in many alternative methods for computing the model evidence, allows us to develop SBI model comparison techniques for the three main neural density estimation approaches, including neural posterior estimation (NPE), neural likelihood estimation (NLE), and neural ratio estimation (NRE). We demonstrate and validate our SBI evidence calculation techniques on a range of inference problems, including a gravitational wave example. Moreover, we further validate the accuracy of the learnt harmonic mean estimator, implemented in the HARMONIC software, in likelihood-based settings. These results highlight the potential of HARMONIC as a sampler-agnostic method to estimate the model evidence in both likelihood-based and simulation-based scenarios.
研究动机与目标
- 为解决在模拟推断(SBI)场景中缺乏可靠、通用的贝叶斯模型证据计算方法的问题。
- 在似然函数难以计算或计算成本过高的SBI环境中,实现贝叶斯模型比较。
- 利用学习到的调和平均估计器的采样器无关特性,支持SBI中多种后验采样方法。
- 将harmonic软件的证据估计结果与既有的基于似然的嵌套采样方法进行验证,以评估其准确性。
- 比较三种主要SBI方法——NPE、NLE和NRE——在证据估计方面的性能。
提出的方法
- 使用学习到的调和平均估计器(harmonic),该方法仅从后验样本中估计模型证据,从而与采样策略解耦。
- 将harmonic估计器应用于由任意SBI方法(包括NPE、NLE和NRE)生成的后验样本,实现广泛适用性。
- 采用多阶段验证:首先在基于似然的设置中,以PolyChord和MultiNest作为参考基准;随后在SBI设置中,使用合成和真实世界示例进行验证。
- 使用小提琴图和对数贝叶斯因子比较,评估harmonic估计结果与嵌套采样结果的一致性。
- 在SBI流程中采用摊销和序列训练方案来训练密度估计器,以确保在不同推理场景下的鲁棒性。
- 量化估计器的准确性和方差,发现基于NLE的证据估计相比NPE和NRE具有更低的偏差。
实验结果
研究问题
- RQ1在似然函数难以计算的SBI环境中,学习到的调和平均估计器能否可靠地计算模型证据?
- RQ2当使用相同的后验样本时,证据估计在不同SBI框架(NPE、NLE、NRE)中的表现如何变化?
- RQ3基于harmonic的证据估计与PolyChord和MultiNest等成熟嵌套采样算法的结果在多大程度上一致?
- RQ4SBI方法的选择(摊销与序列)是否会影响通过harmonic进行证据估计的准确性?
- RQ5harmonic估计器能否作为嵌套采样在基于似然和SBI环境中的模型证据计算的可行替代方案?
主要发现
- harmonic中学习到的调和平均估计器在多个测试案例中,其模型证据估计结果与基于似然的嵌套采样方法(MultiNest和PolyChord)结果高度一致。
- 与NPE和NRE相比,基于NLE的证据估计能产生更准确、偏差更小的对数贝叶斯因子估计,尤其在复杂推理问题中表现更优。
- 所有SBI证据估计流程(NPE、NLE、NRE)产生的对数贝叶斯因子总体上倾向于真实源模型,且在基于似然和SBI的估计器之间结果一致。
- harmonic估计器表现出鲁棒性和灵活性,仅需后验样本,且不依赖于生成它们的采样方法。
- 该方法成功扩展至真实世界应用,包括引力波推断问题,展示了在高维、复杂场景中的实际可行性。
- 本研究凸显了harmonic作为SBI中贝叶斯模型选择通用工具的潜力,未来工作将聚焦于方差估计及在更大规模问题上的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。