Skip to main content
QUICK REVIEW

[论文解读] On the Pitfalls of Nested Monte Carlo

Tom Rainforth, Robert Cornish|arXiv (Cornell University)|Dec 3, 2016
Markov Chains and Monte Carlo Methods参考文献 17被引用 6
一句话总结

本文分析了用于估计包含不可计算内层期望的期望值的嵌套蒙特卡洛(NMC)方法,证明了通用型NMC方案本质上存在偏差且收敛速度降低。文章建立了收敛条件,推导了理论收敛速率,并通过实验验证了这些结论,警告在概率编程和实验设计中避免对推理与模型进行简单组合。

ABSTRACT

There is an increasing interest in estimating expectations outside of the classical inference framework, such as for models expressed as probabilistic programs. Many of these contexts call for some form of nested inference to be applied. In this paper, we analyse the behaviour of nested Monte Carlo (NMC) schemes, for which classical convergence proofs are insufficient. We give conditions under which NMC will converge, establish a rate of convergence, and provide empirical data that suggests that this rate is observable in practice. Finally, we prove that general-purpose nested inference schemes are inherently biased. Our results serve to warn of the dangers associated with naive composition of inference and models.

研究动机与目标

  • 研究嵌套蒙特卡洛(NMC)方案的理论行为,其中外层期望依赖于一个不可计算的内层期望。
  • 识别NMC估计器收敛的条件,并量化其收敛速率。
  • 证明通用型NMC推理本质上存在偏差,即使内层和外层估计器各自无偏。
  • 通过在具有已知真实值的合成模型上进行经验评估,验证理论收敛速率。
  • 警告在概率编程系统中避免对推理与模型进行简单组合,特别是针对边缘期望的非线性函数。

提出的方法

  • 将嵌套期望问题表述为 $ I = \mathbb{E}_{y \sim p(y)}[f(y, \gamma(y))] $,其中 $ \gamma(y) = \mathbb{E}_{z \sim p(z|y)}[\phi(y,z)] $,并通过蒙特卡洛采样近似两个期望。
  • 提出一种两级蒙特卡洛估计器 $ I_{N,M} = \frac{1}{N}\sum_{n=1}^N f(y_n, \hat{\gamma}_{M,n}) $,其中 $ y_n \sim p(y) $,$ z_{n,m} \sim p(z|y_n) $,且 $ \hat{\gamma}_{M,n} = \frac{1}{M}\sum_{m=1}^M \phi(y_n, z_{n,m}) $。
  • 在 $ f $ 的弱正则性条件下建立收敛性,表明当 $ N, M \to \infty $ 时,有 $ \mathbb{E}[I_{N,M}] \to I $,收敛速率为 $ O(1/\sqrt{N}) + O(1/\sqrt{M}) $。
  • 通过证明不存在无偏估计器来证明任何通用型NMC方案必然存在偏差,除非问题可重述为单一期望形式。
  • 基于贝叶斯实验设计中期望信息增益的反例,说明对边缘分布的非线性泛函无法实现无偏估计。
  • 通过一个合成模型($ y \sim \text{Uniform}(-1,1) $,$ z \sim \mathcal{N}(0,1) $,$ \phi(y,z) = \sqrt{2/\pi} \exp(-2(y-z)^2) $,$ f(y, \gamma(y)) = \log(\gamma(y)) $)的经验评估,验证理论收敛速率,结果表明观测到的速率与 $ O(1/\sqrt{T}) $ 一致。

实验结果

研究问题

  • RQ1在何种条件下,嵌套蒙特卡洛估计器会收敛到真实期望?
  • RQ2嵌套蒙特卡洛估计器的理论收敛速率是多少?是否与经验观察一致?
  • RQ3为何通用型嵌套推理本质上存在偏差,即使内层和外层估计器各自无偏?
  • RQ4能否使用标准NMC对边缘分布的非线性泛函(例如后验分布的熵)实现无偏估计?
  • RQ5在实际应用中,如贝叶斯实验设计,NMC实现的收敛速度慢和偏差问题在多大程度上影响了真实世界的表现?

主要发现

  • 在对外层函数 $ f $ 的弱正则性条件下,嵌套蒙特卡洛估计器会收敛到真实期望,但仅当内层估计器的样本量 $ M $ 随 $ N $ 增大时才可保证收敛。
  • NMC的收敛速率受 $ O(1/\sqrt{N}) + O(1/\sqrt{M}) $ 限制,显著慢于标准蒙特卡洛的 $ O(1/\sqrt{N}) $ 速率。
  • 对于内层期望的非线性泛函(如 $ \mathbb{E}[\log(\mathbb{E}[\phi(y,z)|y])] $),通用型嵌套推理方案本质上存在偏差,即使内层和外层估计器均无偏。
  • 在具有已知解的合成模型上的经验结果证实,理论收敛速率 $ O(1/\sqrt{T}) $ 在实践中可观测,验证了理论边界的可靠性。
  • 偏差的根本原因在于 $ f $ 的非线性,即使在外层和内层采样独立时也无法消除,即便两个估计器本身无偏。
  • 仅在特殊情况下(如线性 $ f $)可通过引入辅助变量将问题重述为单一期望,但对于一般非线性泛函(如熵或信息增益)则不成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。