Skip to main content
QUICK REVIEW

[论文解读] Nonparametric learning from Bayesian models with randomized objective functions

Simon Lyddon, Stephen G. Walker|arXiv (Cornell University)|Jun 29, 2018
Bayesian Methods and Mixture Models参考文献 13被引用 15
一句话总结

本文提出了一种可扩展的贝叶斯非参数学习框架,通过将非参数先验集中在参数模型上,放松了对模型正确的假设,利用浓度参数 $ c $ 平衡对模型与经验数据的信任。该方法在模型误设条件下实现稳健推断,支持先验正则化,并在预测性能上优于标准参数模型和变分贝叶斯方法,且其马尔可夫链蒙特卡洛采样方案可轻松并行化。

ABSTRACT

Bayesian learning is built on an assumption that the model space contains a true reflection of the data generating mechanism. This assumption is problematic, particularly in complex data environments. Here we present a Bayesian nonparametric approach to learning that makes use of statistical models, but does not assume that the model is true. Our approach has provably better properties than using a parametric model and admits a Monte Carlo sampling scheme that can afford massive scalability on modern computer architectures. The model-based aspect of learning is particularly attractive for regularizing nonparametric inference when the sample size is small, and also for correcting approximate approaches such as variational Bayes (VB). We demonstrate the approach on a number of examples including VB classifiers and Bayesian random forests.

研究动机与目标

  • 为解决贝叶斯推断中假设模型为正确的根本性局限,该假设在复杂高维数据场景中常被违反。
  • 开发一种非参数贝叶斯框架,在不依赖模型正确性的前提下,整合来自参数模型的先验知识,增强对模型误设的鲁棒性。
  • 通过后验自助采样器实现可扩展且可并行化的推断,该采样器结合了观测数据与来自参数后验的伪样本。
  • 通过将方法嵌入非参数后验更新中,校正变分贝叶斯等方法中的近似误差。
  • 通过在非参数后验下随机化目标函数,实现对效用函数(如中位数)的直接推断。

提出的方法

  • 该方法使用以参数模型为中心的贝叶斯非参数先验,浓度参数 $ c $ 控制模型推断与经验数据之间的相对影响。
  • 它在包含观测数据和来自参数后验的伪样本的扩展数据集上执行后验自助采样,从而实现从非参数后验中进行蒙特卡洛采样。
  • 通过在抽样分布上施加狄利克雷过程先验,对目标函数进行随机化,从而得到量化不确定性的随机化最大似然估计器,且无需假设模型正确。
  • 该方法通过整合先验信息并允许在非参数先验下进行完整贝叶斯更新,推广了加权似然自助采样方法。
  • 在基于模型的推断中,当 $ c \to \infty $ 时,该方法恢复标准贝叶斯更新;当 $ c = 0 $ 时,退化为贝叶斯自助采样,提供连续插值。
  • 该采样器可轻松并行化:一旦生成参数后验样本,非参数更新即可在各粒子上独立执行。

实验结果

研究问题

  • RQ1如何在不假设模型正确的前提下,使贝叶斯非参数学习对模型误设保持稳健?
  • RQ2能否构建一种非参数后验,使其在不依赖模型有效性的前提下,整合来自参数模型的先验知识?
  • RQ3在非参数框架中,浓度参数 $ c $ 如何控制模型驱动与数据驱动推断之间的权衡?
  • RQ4该框架能否通过将方法嵌入非参数后验中,校正变分贝叶斯中的近似误差?
  • RQ5在直接基于效用的推断中,例如在模型误设下估计总体中位数,该方法的性能如何?

主要发现

  • 当模型误设时,该方法在预测准确性上优于标准参数贝叶斯模型和变分贝叶斯方法,尤其在小样本情形下表现更优。
  • 对于贝叶斯随机森林,所提出的 BRF 方法性能与在原始数据与合成数据合并后训练的完整随机森林(RF-all)相当,同时通过仅使用合成样本保护了数据隐私。
  • 浓度参数 $ c $ 的最优值在经验上发现约等于外部训练数据集的大小,与将其解释为有效样本量的含义一致。
  • 当 $ c = 0 $ 时,该方法退化为贝叶斯自助采样,后验在样本中位数处呈现尖锐峰值,且支持集被限制在观测范围内。
  • 随着 $ c $ 增大,后验变得更为平滑,且受参数模型的影响逐渐增强,最终当 $ c \to \infty $ 时收敛至参数后验。
  • 即使模型误设,后验自助采样仍能为估计量提供合理且有依据的不确定性量化,其目标是使 KL 散度最小化的参数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。