Skip to main content
QUICK REVIEW

[论文解读] Lifelong Bayesian Optimization

Yao Zhang, James Jordon|arXiv (Cornell University)|May 29, 2019
Gaussian Processes and Bayesian Inference参考文献 42被引用 6
一句话总结

终身贝叶斯优化(Lifelong Bayesian Optimization, LBO)是一种多任务贝叶斯优化框架,通过动态学习随时间陆续到达的数据集之间的共享表征,以加速超参数优化。通过使用贝叶斯非参数先验(印度餐厅过程)自适应地为新函数引入神经网络,LBO 在合成数据集和真实世界医疗数据集上均实现了比标准贝叶斯优化和多任务基线方法更快的收敛速度和更优的鲁棒性。

ABSTRACT

Automatic Machine Learning (Auto-ML) systems tackle the problem of automating the design of prediction models or pipelines for data science. In this paper, we present Lifelong Bayesian Optimization (LBO), an online, multitask Bayesian optimization (BO) algorithm designed to solve the problem of model selection for datasets arriving and evolving over time. To be suitable for "lifelong" Bayesian Optimization, an algorithm needs to scale with the ever increasing number of acquisitions and should be able to leverage past optimizations in learning the current best model. We cast the problem of model selection as a black-box function optimization problem. In LBO, we exploit the correlation between functions by using components of previously learned functions to speed up the learning process for newly arriving datasets. Experiments on real and synthetic data show that LBO outperforms standard BO algorithms applied repeatedly on the data.

研究动机与目标

  • 解决随时间不断到达并演化的数据集的模型选择挑战,特别是在医疗等现实应用中,数据持续被收集。
  • 克服标准贝叶斯优化在每个新数据集上均从零开始重新初始化的局限,从而更高效地利用历史优化数据。
  • 利用对应于相关数据集的黑箱函数之间的相关性,提升超参数优化中的样本效率和收敛速度。
  • 开发一种可扩展的在线方法,避免从头开始重新训练,并在新数据集与以往数据集显著不同时仍能保持性能。
  • 提出一种灵活的非参数方法,以建模数据集之间的共享结构,而无需假设潜在函数的固定数量或所有任务间共享神经网络。

提出的方法

  • 采用贝叶斯非参数先验(印度餐厅过程)以确定为建模黑箱函数而引入多少神经网络,从而实现对新数据集的动态适应。
  • 使用变分推理框架联合优化神经网络参数和潜在变量,实现跨任务共享表征的端到端学习。
  • 将每个黑箱函数建模为具有共享深度神经网络基核的高斯过程,以捕捉相关数据集之间的相关性。
  • 仅在印度餐厅过程后验相关性概率表明有必要时才引入特定任务的神经网络,从而确保灵活性并避免对不相似任务的过拟合。
  • 应用多任务贝叶斯优化框架,其中采集函数同时基于当前数据和从先前数据集学习到的共享表征进行优化。
  • 采用稀疏近似技术以保持计算效率,尤其在数据集数量和函数评估次数随时间增长时。

实验结果

研究问题

  • RQ1贝叶斯优化框架能否有效利用来自相关数据集的历史优化数据,以加速对新到达数据集的学习?
  • RQ2模型如何动态决定何时重用现有表征,何时为新到达的数据集引入新表征?
  • RQ3对共享表征采用非参数先验(通过印度餐厅过程)是否相比固定或预设的多任务结构能带来更好的性能和鲁棒性?
  • RQ4在真实世界数据上,所提方法与标准贝叶斯优化和现有多任务贝叶斯优化方法相比,在收敛速度和最终性能方面表现如何?
  • RQ5当新数据集的分布相对于以往数据集发生偏移时,该方法在多大程度上仍保持有效性?

主要发现

  • 在所有三个UNOS数据集(UNOS-I、II、III)上,LBO在仅进行50次函数评估后,最大AUC表现优于标准贝叶斯优化和多任务基线方法(如MTGP、ABL-R-50、ABL-R-100)。
  • 在UNOS-I数据集上,LBO相对于随机搜索的归一化AUC约为1.25–1.30,表明在前50次评估内性能提升了25–30%。
  • LBO在不同数据重叠程度(4–6年)下均保持一致的性能,表现出对分布偏移和随时间推移的数据衰减的鲁棒性。
  • 该方法能成功识别何时需要引入新的神经网络——例如,对于UNOS-III,引入了新的网络$ g_3 $,表明其避免了将不相似的函数强行纳入共享表征。
  • 在合成实验中,LBO能准确建模函数之间的相关性结构,当出现新的、不相关的数据集时,活跃神经网络的数量能适当增长。
  • 变分推理框架支持可扩展训练,且当数据集数量增加时,模型仍能良好泛化,无需从头开始重新训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。