Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Bayesian Optimization with Deep Kernel Surrogates

Martin Wistuba, Josif Grabocka|arXiv (Cornell University)|Jan 19, 2021
Machine Learning and Data Classification参考文献 25被引用 6
一句话总结

本文提出少样本贝叶斯优化(FSBO),采用深度核代理模型,通过共享初始化的元学习深度核高斯过程,在少量评估下快速适应新的超参数优化任务。该方法通过端到端的元学习核参数与数据驱动的贝叶斯优化热启动初始化,结合在多种超参数优化基准上实现最先进性能。

ABSTRACT

Hyperparameter optimization (HPO) is a central pillar in the automation of machine learning solutions and is mainly performed via Bayesian optimization, where a parametric surrogate is learned to approximate the black box response function (e.g. validation error). Unfortunately, evaluating the response function is computationally intensive. As a remedy, earlier work emphasizes the need for transfer learning surrogates which learn to optimize hyperparameters for an algorithm from other tasks. In contrast to previous work, we propose to rethink HPO as a few-shot learning problem in which we train a shared deep surrogate model to quickly adapt (with few response evaluations) to the response function of a new task. We propose the use of a deep kernel network for a Gaussian process surrogate that is meta-learned in an end-to-end fashion in order to jointly approximate the response functions of a collection of training data sets. As a result, the novel few-shot optimization of our deep kernel surrogate leads to new state-of-the-art results at HPO compared to several recent methods on diverse metadata sets.

研究动机与目标

  • 将超参数优化重新构想为少样本学习问题,以实现极小评估次数下的快速适应。
  • 开发一种可扩展的共享深度核代理模型,通过元学习在多个任务间实现泛化。
  • 通过端到端元优化核参数的迁移学习,提升贝叶斯优化的收敛性能。
  • 利用元学习代理模型提供数据驱动的贝叶斯优化热启动初始化。
  • 在超参数优化中显著优于现有迁移学习基线方法。

提出的方法

  • 使用深度核网络作为高斯过程代理模型,其中神经网络组件在所有任务间共享。
  • 在一组元任务上进行端到端的元学习,以初始化核参数,实现快速适应。
  • 在推理阶段应用深度核的微调,以少量评估适应新的目标任务。
  • 通过元学习代理模型生成热启动初始化,指导初始贝叶斯优化采样点。
  • 采用少样本学习范式,联合优化代理模型在多个任务上的核超参数。
  • 通过元学习期间对任务特定参数的积分,避免每个任务单独增长模型。

实验结果

研究问题

  • RQ1超参数优化能否被有效重新概念化为少样本学习问题?
  • RQ2能否通过元学习共享的深度核代理模型,实现在少量评估下对新任务的快速适应?
  • RQ3与固定或随机初始化的代理模型相比,端到端元学习核参数是否能提升贝叶斯优化的收敛性能?
  • RQ4所提出的热启动初始化与随机采样或拉丁超立方采样相比表现如何?
  • RQ5在少样本适应过程中,微调深度核与仅初始化相比,其贡献是什么?

主要发现

  • FSBO 在多个超参数优化基准上实现最先进性能,显著优于近期 ICLR 和 NeurIPS 基线方法。
  • 微调深度核参数显著提升适应能力,防止因元学习网络强先验导致的过早利用。
  • 由代理模型导出的热启动初始化始终优于随机采样与拉丁超立方采样,尤其在 GLMNet 和 SVM 任务上表现更优。
  • 固定神经网络权重的多头高斯过程基线表现较差,表明参数适应对有效迁移至关重要。
  • 所提方法在任务数量增加时仍具有良好可扩展性,因其复杂度不随任务数量增长,得益于元学习的参数共享机制。
  • 消融实验确认,元学习、微调与热启动三个组件对最终性能均有独立且显著的贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。