Skip to main content
QUICK REVIEW

[论文解读] Bayesian Optimization of Composite Functions

Raul Astudillo, Peter I. Frazier|arXiv (Cornell University)|Jun 4, 2019
Gaussian Processes and Bayesian Inference参考文献 4被引用 6
一句话总结

本文提出了一种用于复合函数的期望改进方法(EI-CF),该方法通过建模 $f(x) = g(h(x))$ 的复合结构,利用多输出高斯过程对 $h(x)$ 进行建模,并采用基于模拟的获取函数,以考虑 $f$ 上非高斯后验分布的影响。该方法显著提升了采样效率,与标准贝叶斯优化相比,简单遗憾(simple regret)降低了几个数量级。

ABSTRACT

We consider optimization of composite objective functions, i.e., of the form $f(x)=g(h(x))$, where $h$ is a black-box derivative-free expensive-to-evaluate function with vector-valued outputs, and $g$ is a cheap-to-evaluate real-valued function. While these problems can be solved with standard Bayesian optimization, we propose a novel approach that exploits the composite structure of the objective function to substantially improve sampling efficiency. Our approach models $h$ using a multi-output Gaussian process and chooses where to sample using the expected improvement evaluated on the implied non-Gaussian posterior on $f$, which we call expected improvement for composite functions (\ei). Although \ei\ cannot be computed in closed form, we provide a novel stochastic gradient estimator that allows its efficient maximization. We also show that our approach is asymptotically consistent, i.e., that it recovers a globally optimal solution as sampling effort grows to infinity, generalizing previous convergence results for classical expected improvement. Numerical experiments show that our approach dramatically outperforms standard Bayesian optimization benchmarks, reducing simple regret by several orders of magnitude.

研究动机与目标

  • 为解决昂贵的、难以求导的向量值函数 $h$ 与廉价可计算的 $g$ 构成的复合目标函数 $f(x) = g(h(x))$ 的优化挑战。
  • 通过利用 $h$ 与 $g$ 之间的结构关系,而非将 $f$ 视为黑箱,从而提升贝叶斯优化中的采样效率。
  • 开发一种能够捕捉由 $h$ 上的高斯过程模型在 $f$ 上诱导出的非高斯后验分布的获取函数,以支持更明智的采样决策。
  • 在较弱的正则性条件下保证优化过程的渐近一致性,确保收敛至全局最优解。

提出的方法

  • 使用多输出高斯过程(GP)对内层函数 $h(x)$ 建模,以捕捉其输出之间的相关性。
  • 将获取函数定义为在 $f(x) = g(h(x))$ 上所隐含的非高斯后验分布下的期望改进(EI),称为复合函数期望改进(EI-CF)。
  • 使用蒙特卡洛模拟计算 EI-CF 梯度的无偏估计量,从而通过随机梯度上升法实现高效最大化。
  • 利用 $g$ 的廉价计算特性,将不确定性从 $h$ 传播至 $f$,而无需直接将 $f$ 建模为高斯过程。
  • 在缺乏闭式表达式的情况下,应用一种新颖的随机梯度估计器来最大化 EI-CF。
  • 通过证明随着评估次数增加,所找到的最佳解收敛至全局最优解,从而确保渐近一致性。

实验结果

研究问题

  • RQ1通过使用多输出高斯过程对内层函数 $h(x)$ 建模,并利用其在 $f(x) = g(h(x))$ 上诱导的后验分布,是否能实现比标准贝叶斯优化更高效的优化?
  • RQ2当 $g$ 为非线性函数时,如何对期望改进获取函数进行调整,以考虑 $f$ 上的非高斯后验分布?
  • RQ3对于缺乏闭式表达式的获取函数,其最大化在计算上是否可行?如何实现高效优化?
  • RQ4随着函数评估次数的增加,所提出的 EI-CF 方法是否能收敛至全局最优解?
  • RQ5在简单遗憾和收敛速度方面,EI-CF 与标准贝叶斯优化基准相比表现如何?

主要发现

  • 与标准贝叶斯优化基准相比,EI-CF 将简单遗憾降低了几个数量级。
  • 该方法在使用少于四分之一的函数评估次数下,达到了标准贝叶斯优化的最终解质量。
  • 所提出的随机梯度估计器使得即使在缺乏闭式表达式的情况下,也能高效地最大化 EI-CF。
  • EI-CF 具有渐近一致性,即随着样本量趋于无穷大,其收敛至全局最优解。
  • 该方法通过利用从 $f(x)$ 评估中无法获得的 $h(x)$ 中的信息,在非线性场景下表现更优,尤其在非线性设置中。
  • 数值实验表明,当 $g$ 为非线性且 $h$ 为连续函数时,该方法特别有效,因为它能够检测到 $h$ 中的结构特征(如符号变化),这些特征可指示极小值的存在。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。