[论文解读] A Study of Bayesian Neural Network Surrogates for Bayesian Optimization
本文评估了贝叶斯神经网络(BNNs)作为贝叶斯优化中代理模型的性能,对比了多种推断方法——包括哈密顿蒙特卡洛(HMC)、深度集成和无限宽度BNNs——与标准高斯过程(GPs)的表现。研究发现,在高维和非平稳设置下,无限宽度BNNs与HMC推断的有限宽度BNNs优于标准GPs;而完全随机性并非始终有益,表明在小样本贝叶斯优化中,网络架构先验比随机性更为重要。
Bayesian optimization is a highly efficient approach to optimizing objective functions which are expensive to query. These objectives are typically represented by Gaussian process (GP) surrogate models which are easy to optimize and support exact inference. While standard GP surrogates have been well-established in Bayesian optimization, Bayesian neural networks (BNNs) have recently become practical function approximators, with many benefits over standard GPs such as the ability to naturally handle non-stationarity and learn representations for high-dimensional data. In this paper, we study BNNs as alternatives to standard GP surrogates for optimization. We consider a variety of approximate inference procedures for finite-width BNNs, including high-quality Hamiltonian Monte Carlo, low-cost stochastic MCMC, and heuristics such as deep ensembles. We also consider infinite-width BNNs, linearized Laplace approximations, and partially stochastic models such as deep kernel learning. We evaluate this collection of surrogate models on diverse problems with varying dimensionality, number of objectives, non-stationarity, and discrete and continuous inputs. We find: (i) the ranking of methods is highly problem dependent, suggesting the need for tailored inductive biases; (ii) HMC is the most successful approximate inference procedure for fully stochastic BNNs; (iii) full stochasticity may be unnecessary as deep kernel learning is relatively competitive; (iv) deep ensembles perform relatively poorly; (v) infinite-width BNNs are particularly promising, especially in high dimensions.
研究动机与目标
- 探究贝叶斯神经网络(BNNs)是否可作为贝叶斯优化中高斯过程(GP)代理模型的有效替代方案。
- 评估广泛的BNN推断方法,包括哈密顿蒙特卡洛(HMC)、随机梯度MCMC、深度集成和无限宽度极限。
- 评估随机性、表征学习和非平稳性对不同类型问题优化性能的影响。
- 确定BNN中定制的归纳偏置是否相比标准GP代理模型能提升优化效率。
- 为贝叶斯优化中的代理模型选择提供一个无模型特定设计偏见的无偏评估框架。
提出的方法
- 采用完全随机的多层BNN,通过哈密顿蒙特卡洛(HMC)、随机梯度MCMC和深度集成进行近似推断。
- 考虑无限宽度BNNs,其对应于由神经网络架构导出的非平稳核函数的高斯过程。
- 评估部分随机模型,如深度核学习(DKL),其中仅最后一层为贝叶斯化。
- 使用仅需后验样本的蒙特卡洛获取函数,使非GP代理模型无需闭式预测分布即可使用。
- 采用多样化的基准测试套件,包括合成问题、真实世界问题和高维问题,涵盖不同输入类型(离散/连续)、维度和目标(单目标/多目标)。
- 在每个基准测试中进行5次受控比较,报告平均性能及标准误。
实验结果
研究问题
- RQ1与标准高斯过程相比,使用贝叶斯神经网络作为代理模型是否能提升优化性能?
- RQ2在贝叶斯优化中,有限宽度BNNs的不同近似推断方法(如HMC、深度集成、SG-MCMC)表现如何比较?
- RQ3BNN中的完全随机性是否对性能提升是必要的?还是仅使用确定性表征(如通过无限宽度极限或DKL)已足够?
- RQ4在高斯过程表现不佳的非平稳和高维优化问题中,BNN代理模型表现如何?
- RQ5深度架构中的表征学习是否能在贝叶斯优化中带来优势?还是神经网络架构的归纳偏置更为关键?
主要发现
- 哈密顿蒙特卡洛(HMC)是完全随机BNNs中最有效的近似推断方法,始终优于随机梯度MCMC和深度集成。
- 尽管在其他机器学习场景中表现优异,深度集成在贝叶斯优化中表现出人意料的不佳,表明其并不适合小样本优化。
- 无限宽度BNNs在高维优化中尤为有效,通常优于有限宽度BNNs和标准GPs,表明架构先验具有极高价值。
- 部分随机的深度核学习(DKL)与完全随机BNNs表现相当,表明性能提升可能并不需要参数的完全随机化。
- 标准高斯过程由于其强先验和精确推断,在标准基准测试中仍具竞争力,但在非平稳和多目标设置中被BNNs超越。
- 无单一代理模型在所有问题上均占优,凸显了需根据优化目标的具体特征定制归纳偏置的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。