Skip to main content
QUICK REVIEW

[论文解读] Likelihood-free inference with an improved cross-entropy estimator

Markus Stoye, Johann Brehmer|arXiv (Cornell University)|Aug 2, 2018
Gaussian Processes and Bayesian Inference参考文献 23被引用 21
一句话总结

本文提出了 Alice 和 Alices 两种无需似然函数的推断方法,其核心是利用从模拟器中提取的联合似然比与得分信息,改进交叉熵估计器。通过降低训练目标的方差,这些方法在训练数据有限时,相比 Rascal、Cascal 和 Rolr 等先前技术,实现了显著更高的样本效率。

ABSTRACT

We extend recent work (Brehmer, et. al., 2018) that use neural networks as surrogate models for likelihood-free inference. As in the previous work, we exploit the fact that the joint likelihood ratio and joint score, conditioned on both observed and latent variables, can often be extracted from an implicit generative model or simulator to augment the training data for these surrogate models. We show how this augmented training data can be used to provide a new cross-entropy estimator, which provides improved sample efficiency compared to previous loss functions exploiting this augmented training data.

研究动机与目标

  • 为解决由于复杂模拟器导致似然函数不可计算时,无需似然函数推断中的样本效率低下问题。
  • 通过降低用于代理模型训练的损失函数中的方差,提升训练稳定性和收敛性。
  • 利用模拟器中提取的额外信息——联合似然比与得分,以提升基于神经网络的似然比估计器的质量。
  • 开发一种新型交叉熵估计器,其在有限样本情形下优于标准均方误差与基线交叉熵方法。
  • 证明改进后的估计器可产生更可靠、更紧致的统计推断区间,尤其在低数据量情形下表现更优。

提出的方法

  • 该方法使用从模拟器中提取的联合似然比 $ r(x,z|\theta_0,\theta_1) $ 和联合得分 $ t(x,z|\theta_0) $ 作为辅助训练信号。
  • 提出一种新型交叉熵损失 $ L_{\textsc{Alice}} $,其使用可计算的 $ s(x,z|\theta_0,\theta_1) = \frac{1}{r(x,z|\theta_0,\theta_1)+1} $ 作为目标,替代高方差的二值标签 $ y_i \in \{0,1\} $。
  • 与标准交叉熵和均方误差损失相比,该改进估计器可显著降低损失函数的方差,从而实现更快且更稳定的训练。
  • 该方法被扩展为 Alices,通过使用成对的联合似然比,将二值交叉熵框架推广至多参数点情形。
  • 该方法在合成数据与真实世界粒子物理模拟中均得到验证,性能通过频率学覆盖概率与排除极限进行评估。
  • 通过神经网络优化训练目标以近似似然比,性能通过奈曼构造法与真实值对比进行评估。

实验结果

研究问题

  • RQ1基于模拟器提取的联合似然比构建的低方差交叉熵估计器,是否能提升无需似然函数推断中的样本效率?
  • RQ2在训练数据有限的情况下,新估计器与 Rascal、Cascal 和 Rolr 等现有方法相比,其收敛速度与准确率如何?
  • RQ3与基线方法相比,改进后的估计器在多大程度上减少了统计排除极限中的过度乐观倾向?
  • RQ4交叉熵框架能否超越二值比较,通过使用成对联合似然比推广至多参数推断?
  • RQ5使用联合似然比与得分是否能提升置信区间构造中频率学覆盖的可靠性?

主要发现

  • 在 $ 10^5 $ 个样本的小型训练集下,Alice 和 Alices 显著优于 Rolr、Cascal 和 Rascal,展现出更高的样本效率。
  • 改进的交叉熵估计器降低了损失函数的方差,从而加快了神经网络代理模型的收敛速度,并提升了训练稳定性。
  • 在包含探测器效应的粒子物理场景中,即使数据有限,Alices 生成的排除极限也几乎与基于真实似然比的结果无法区分。
  • 在训练数据稀缺时,Alice 和 Alices 在频率学置信区间的覆盖概率与精度方面均优于 Rascal 和 Cascal。
  • 当训练样本量达到 $ 10^7 $ 时,Alice、Alices 与 Rascal 的性能几乎无法区分,表明其具有强大的渐近收敛性。
  • 该方法对排除极限中的过度乐观现象具有鲁棒性,避免了 Rolr 等方法中常见的过度乐观区间,且在奈曼构造下保持了正确的覆盖概率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。