[论文解读] An Auto-validating Rejection Sampler
该论文提出了一种基于区间分析的自动验证拒绝采样方法,可在无需已知归一化常数的情况下,从复杂、高维的目标密度中生成独立样本。通过区间算术严格Bounding函数评估,该方法保证了每个样本的正确性,并在多峰或病态密度(如女巫帽分布)下仍能实现高接受率。
In Bayesian statistical inference and computationally intensive frequentist inference, one is interested in obtaining samples from a high dimensional, and possibly multi-modal target density. The challenge is to obtain samples from this target without any knowledge of the normalizing constant. Several approaches to this problem rely on Monte Carlo methods. One of the simplest such methods is the rejection sampler due to von Neumann. Here we introduce an auto-validating version of the rejection sampler via interval analysis. We show that our rejection sampler does provide us with independent samples from a large class of target densities in a guaranteed manner. We illustrate the efficiency of the sampler by theory and by examples in up to 10 dimensions. Our sampler is immune to the `pathologies' of some infamous densities including the witch's hat and can rigorously draw samples from piece-wise Euclidean spaces of small phylogenetic trees.
研究动机与目标
- 开发一种采样方法,即使在归一化常数未知的情况下,也能保证从目标密度中抽取的每个样本的正确性。
- 解决传统拒绝采样在高维、多峰或病态目标密度下的局限性。
- 将区间分析集成到拒绝采样中,构建一种自验证算法,提供样本正确性的计算机辅助证明。
- 在高达10维的场景下确保高效率与可扩展性,并对接受概率提供理论保证。
提出的方法
- 该方法使用区间算术计算目标密度 $p^*$ 和提议密度 $q^*$ 的自然区间扩展,以确保对函数值的严格边界。
- 构造一个包络函数 $f_q = c q^*$,使得对定义域内所有 $\theta$ 都有 $f_q(\theta) \geq p^*(\theta)$,其中 $c$ 的选择旨在最小化低效性。
- 该算法从提议分布 $q^*$ 中生成一个候选样本 $T$,然后生成一个在 $[0, f_q(T)]$ 上均匀分布的高度 $H$,若 $H \leq p^*(T)$ 则接受 $T$。
- 使用区间扩展 $P^*$ 和 $Q^*$ 来计算 $p^*$ 和 $q^*$ 的边界,确保接受决策在数学上严格且不受浮点数误差影响。
- 通过将定义域细分为更小的区间实现自适应优化,随着 $1 - \mathcal{O}(1/W)$ 的渐近速率提升精度与接受概率。
- 该采样器已实现于一个开源 C++ 库中,支持对复杂密度的可重现与可验证采样。
实验结果
研究问题
- RQ1能否利用区间分析构建一种拒绝采样方法,通过计算机辅助证明保证每个样本的正确性?
- RQ2在高维空间中,随着定义域细分,基于区间的拒绝采样器的接受概率如何变化?
- RQ3该方法能否高效地从非对数凹、多峰或病态密度(如女巫帽分布)中采样?
- RQ4当定义域划分为更细的区间时,接受概率的理论渐近行为如何?
- RQ5该采样器的自动验证特性相比传统浮点数拒绝采样在可靠性方面有何提升?
主要发现
- Moore 拒绝采样器(MRS)以数学保证生成来自目标密度 $p$ 的独立样本,每个样本均附带计算机辅助证明的正确性。
- 接受概率 $\mathbf{A}^p_{\mathfrak{U}_W}$ 随着定义域被划分为 $W$ 个区间,以 $1 - \mathcal{O}(1/W)$ 的速率趋近于 1,确保在细分下具有高效率。
- 该方法成功实现了对非对数凹与多峰密度的采样,包括著名的女巫帽分布,该分布会导致标准采样器失效。
- MRS 在高达 10 维的场景下表现稳健,展示了在高维设置下的可扩展性与可靠性。
- 理论分析证实,对 $p^*$ 和 $q^*$ 的区间边界确保了不会因浮点数运算或近似而引入采样误差。
- 一个开源的 C++ 实现已公开发布,支持在贝叶斯与频率学派推断中的可重现性与实际应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。