[论文解读] Multiple Adaptive Bayesian Linear Regression for Scalable Bayesian Optimization with Warm Start
本文提出一种基于共享神经网络的多任务自适应贝叶斯线性回归(ABL-R),以实现可扩展的贝叶斯优化(BO)与跨多个任务的迁移学习。通过联合学习深度特征表示与特定任务的线性模型,该方法实现了与数据规模成线性关系的计算复杂度——不同于计算复杂度为立方级的高斯过程——同时利用相关任务的先前评估结果实现贝叶斯优化的热启动,显著加速了超参数优化的收敛速度。
Bayesian optimization (BO) is a model-based approach for gradient-free black-box function optimization. Typically, BO is powered by a Gaussian process (GP), whose algorithmic complexity is cubic in the number of evaluations. Hence, GP-based BO cannot leverage large amounts of past or related function evaluations, for example, to warm start the BO procedure. We develop a multiple adaptive Bayesian linear regression model as a scalable alternative whose complexity is linear in the number of observations. The multiple Bayesian linear regression models are coupled through a shared feedforward neural network, which learns a joint representation and transfers knowledge across machine learning problems.
研究动机与目标
- 为解决基于高斯过程的贝叶斯优化存在的可扩展性瓶颈问题,该方法在数据规模增大时计算复杂度呈立方级增长,且难以复用历史评估结果。
- 通过利用多个相关任务(如不同数据集或机器学习工作流)的知识,实现在贝叶斯优化中的有效迁移学习。
- 开发一种模型,在保持贝叶斯方法不确定性量化能力的同时,实现与观测样本数量成线性关系的计算复杂度,适用于大规模部署。
- 联合优化特征表示(通过神经网络)与特定任务的贝叶斯线性模型,避免了需要单独预训练步骤。
提出的方法
- 该方法使用一个共享的前馈神经网络,从多个任务的输入中学习深度的、与任务无关的特征表示。
- 每个任务通过一个独立的贝叶斯线性回归(BLR)模型进行建模,其权重和精度参数基于共享神经网络的输出进行条件化。
- 联合目标函数通过最大化所有任务的对数边缘似然之和来实现,支持端到端训练并具备合理的不确定性传播机制。
- 后验推断具有解析可解性:预测均值与方差通过基于观测数据和模型超参数的闭式高斯更新公式计算得出。
- 该方法通过为每个信号(如验证准确率、训练时间)分别建模多个输出,支持异质信号输入,每个信号拥有独立的精度参数。
- 与随机傅里叶特征和标准高斯过程相比,该方法在迁移学习设置下展现出更优的可扩展性与性能。
实验结果
研究问题
- RQ1能否设计一种可扩展的贝叶斯模型,实现在贝叶斯优化中支持迁移学习,同时避免立方级计算开销?
- RQ2联合学习深度特征表示与特定任务的贝叶斯线性模型,与先独立预训练再微调的方法相比,在优化效率上表现如何?
- RQ3来自相关任务(如不同数据集或信号)的知识在多大程度上能加速超参数优化的收敛?
- RQ4与单输出模型相比,引入多个异质信号(如准确率与训练时间)是否能提升贝叶斯优化的性能?
主要发现
- 在使用来自29个相关任务的数据进行热启动时,基于神经网络基函数的ABL-R在超参数优化中收敛速度优于普通ABL-R或基于GP的BO。
- 该方法与观测样本数量呈线性关系,可应用于包含超过75万次总评估的大规模数据集,而基于GP的方法在规模增大时变得不可行。
- 尽管随机傅里叶特征(RKS)在D=100时计算更快,但使用神经网络基函数的性能仍优于RKS,表明学习到的表示在迁移学习中更具有效性。
- 引入上下文信息(如数据集大小)并未带来一致的性能提升,因此在后续实验中为简化起见被省略。
- 在多信号调优(如验证准确率与训练时间)场景下,将辅助信号引入ABL-R-based超参数优化,显著加速了LIBSVM数据集上的收敛。
- 通过最大化对数边缘似然联合训练神经网络与BLR模型,其性能优于两步法(即先用平方损失预训练网络,再切换到BLR)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。