Skip to main content
QUICK REVIEW

[论文解读] Transfer Learning for Bayesian Optimization on Heterogeneous Search Spaces

Fan Zhou, Xinran Han|arXiv (Cornell University)|Sep 28, 2023
Gaussian Processes and Bayesian Inference被引用 4
一句话总结

本文提出MPHD,一种用于贝叶斯优化的新型迁移学习方法,通过预训练神经网络将领域特定上下文映射到分层高斯过程(GP)先验,实现在异质搜索空间之间的知识迁移。MPHD在未见过的搜索空间上实现了最先进样本效率,在具有异质领域的超参数调优基准测试中优于现有方法。

ABSTRACT

Bayesian optimization (BO) is a popular black-box function optimization method, which makes sequential decisions based on a Bayesian model, typically a Gaussian process (GP), of the function. To ensure the quality of the model, transfer learning approaches have been developed to automatically design GP priors by learning from observations on "training" functions. These training functions are typically required to have the same domain as the "test" function (black-box function to be optimized). In this paper, we introduce MPHD, a model pre-training method on heterogeneous domains, which uses a neural net mapping from domain-specific contexts to specifications of hierarchical GPs. MPHD can be seamlessly integrated with BO to transfer knowledge across heterogeneous search spaces. Our theoretical and empirical results demonstrate the validity of MPHD and its superior performance on challenging black-box function optimization tasks.

研究动机与目标

  • 为解决现有贝叶斯优化迁移学习方法的局限性,即要求训练函数与测试函数之间具有对齐的领域。
  • 开发一种方法,实现从多样化、异质的搜索空间向新、未见过的优化任务的有效知识迁移。
  • 设计一种预训练框架,从无序、分块的数据集中学习领域特定的分层GP先验,而无需依赖BO轨迹顺序。
  • 建立该方法的理论一致性,并在具有异质领域的现实世界超参数调优基准上验证其性能。

提出的方法

  • MPHD预训练一个神经网络,将领域特定上下文(例如,输入维度、变量类型)映射到分层GP先验的超参数。
  • 该方法将每个函数的GP先验建模为分层分布,其中在各维度上的长度尺度和噪声方差上学习超先验。
  • 从具有不同领域的多个函数构建一个超数据集,其中每个函数的数据被分块并关联其领域上下文。
  • 神经网络学习基于领域上下文预测先验分布参数(例如,长度尺度的均值和方差),从而实现对新领域的泛化。
  • 在推理阶段,预训练模型根据测试函数的领域上下文生成定制化的分层GP先验,随后在标准BO中使用获取函数进行优化。
  • 该框架无需有序的BO轨迹,仅需每个函数的分块数据及其关联的领域元数据。

实验结果

研究问题

  • RQ1贝叶斯优化中的迁移学习能否泛化到具有不同、非重叠搜索空间的函数?
  • RQ2如何通过统一模型从多样化领域中学习有效的GP先验,而无需领域对齐?
  • RQ3随着训练数据量增加,MPHD在收敛性和一致性方面提供了哪些理论保证?
  • RQ4在具有异质领域的现实世界超参数调优任务中,MPHD与现有BO方法相比在样本效率上表现如何?
  • RQ5当在一组具有不同领域的函数上预训练后,MPHD能否泛化到未见过的搜索空间?

主要发现

  • 在PD1基准测试中,MPHD在未在测试搜索空间上预训练的方法中表现最佳,甚至在NToT设置下优于专门设计的同质元BO方法。
  • 在HPO-B基准测试中,MPHD展现出对未见过搜索空间的强大泛化能力,显著提升了样本效率。
  • 该方法表现出渐近一致性,随着训练函数数量的增加,收敛至真实先验分布。
  • 在多个测试函数上,MPHD在归一化简单遗憾方面优于标准GP和手工指定的分层GP基线方法。
  • 当在HPO-B上预训练后,MPHD成功泛化到PD1数据集,展示了跨领域迁移能力。
  • 包含领域特定上下文使即使在输入维度和变量类型不同的函数之间,也能实现有效的先验迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。