Skip to main content
QUICK REVIEW

[论文解读] Uncertainty quantification using martingales for misspecified Gaussian processes

Willie Neiswanger, Aaditya Ramdas|arXiv (Cornell University)|Jun 12, 2020
Gaussian Processes and Bayesian Inference参考文献 37被引用 5
一句话总结

该论文提出了一种针对高斯过程(GPs)的频率学派置信序列,即使先验分布错误指定,仍能保持统计有效性,利用鞅技术构建一致有效的不确定性带。与标准GP后验带不同,后者在先验错误时可能产生误导性结果,而所提方法确保了无论先验是否准确,覆盖率概率保证均成立,代价是当先验正确时区间更宽——在实践中表现出稳健性,尤其在贝叶斯优化场景中表现突出。

ABSTRACT

We address uncertainty quantification for Gaussian processes (GPs) under misspecified priors, with an eye towards Bayesian Optimization (BO). GPs are widely used in BO because they easily enable exploration based on posterior uncertainty bands. However, this convenience comes at the cost of robustness: a typical function encountered in practice is unlikely to have been drawn from the data scientist's prior, in which case uncertainty estimates can be misleading, and the resulting exploration can be suboptimal. We present a frequentist approach to GP/BO uncertainty quantification. We utilize the GP framework as a working model, but do not assume correctness of the prior. We instead construct a confidence sequence (CS) for the unknown function using martingale techniques. There is a necessary cost to achieving robustness: if the prior was correct, posterior GP bands are narrower than our CS. Nevertheless, when the prior is wrong, our CS is statistically valid and empirically outperforms standard GP methods, in terms of both coverage and utility for BO. Additionally, we demonstrate that powered likelihoods provide robustness against model misspecification.

研究动机与目标

  • 解决在贝叶斯优化中常见问题:当先验错误指定时,高斯过程的不确定性估计不可靠。
  • 开发一种频率学派方法,为真实函数提供与先验正确性无关的统一有效置信序列。
  • 在伯恩斯坦-冯·米塞斯定理不成立的高维或无限维函数空间中,维持统计有效性。
  • 评估在先验不准确时,使用置信序列替代后验可信区间所涉及的稳健性与精度之间的权衡。
  • 探索在置信序列框架内,对超参数调优和自适应信念参数的实用整合方式。

提出的方法

  • 利用鞅理论构建未知函数的置信序列(CS),确保真实函数以高概率在整个时间范围内始终位于该序列内。
  • 使用函数类 $\mathcal{F}$ 和信念参数 $\gamma$ 定义一个随机过程,以追踪观测数据与先验下预测之间的偏差。
  • 应用序列概率比检验和鞅不等式,推导出基于数据的置信带,其宽度可依据证据自适应地扩大或缩小。
  • 通过引入加权似然函数,增强对模型错误指定的鲁棒性,尤其在从数据中估计超参数时。
  • 使用核化函数类实现该方法,并在每个时间步 $t$ 通过核基投影的凸组合计算置信集 $C_t$。
  • 通过选择 $\mathcal{F}$ 使得置信集在错误指定下仍保持可计算性,确保计算可行性。

实验结果

研究问题

  • RQ1能否为高斯过程构建一种置信序列,使其在任意先验错误指定下仍保持有效覆盖率?
  • RQ2与标准GP后验带相比,所提置信序列在覆盖率和贝叶斯优化中的实用性方面表现如何?
  • RQ3与后验可信区间相比,使用置信序列时稳健性与精度之间的权衡是什么?
  • RQ4最大似然或交叉验证等超参数估计方法能否有意义地整合进置信序列框架?
  • RQ5信念参数 $\gamma$ 如何动态调整,以在信任先验与应对错误指定的稳健性之间取得平衡?

主要发现

  • 所提置信序列即使在GP先验错误指定时,也能在时间上保持统一的覆盖率概率 $\leq \alpha$,确保统计有效性。
  • 当先验正确时,置信序列比标准GP后验带更宽,反映出稳健性的代价。
  • 在先验错误指定下,随着数据增多,置信序列能恢复并包含真实函数,而标准GP带无法收敛至真实值。
  • 在贝叶斯优化模拟中,该方法在覆盖率和实用性方面均优于标准GP不确定性量化方法。
  • 结果表明,加权似然函数能有效提升对模型错误指定的鲁棒性,尤其在从数据中估计超参数时。
  • 结果证实,伯恩斯坦-冯·米塞斯定理在无限维函数空间中不成立,从而为这类场景下采用频率学派置信序列提供了合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。