Skip to main content
QUICK REVIEW

[论文解读] Hyperparameter Learning via Distributional Transfer

Ho Chung Leon Law, Peilin Zhao|arXiv (Cornell University)|Oct 15, 2018
Gaussian Processes and Bayesian Inference参考文献 40被引用 9
一句话总结

该论文提出了一种贝叶斯优化方法,通过将训练数据分布嵌入再生核希尔伯特空间,实现在超参数学习任务间的知识迁移,从而实现对超参数和数据表示的联合建模。该方法通过利用所有过往评估结果(包括次优配置)来实现快速收敛——通常仅需几次评估即可找到最优超参数。

ABSTRACT

Bayesian optimisation is a popular technique for hyperparameter learning but typically requires initial exploration even in cases where similar prior tasks have been solved. We propose to transfer information across tasks using learnt representations of training datasets used in those tasks. This results in a joint Gaussian process model on hyperparameters and data representations. Representations make use of the framework of distribution embeddings into reproducing kernel Hilbert spaces. The developed method has a faster convergence compared to existing baselines, in some cases requiring only a few evaluations of the target objective.

研究动机与目标

  • 解决贝叶斯优化中的'冷启动'问题,即在有效超参数调优开始前需要初始评估。
  • 克服现有迁移学习方法的局限性,这些方法仅依赖函数评估而忽略了训练数据集的结构信息。
  • 开发一种从数据分布中学习任务特定表示的方法,以实现在目标任务无任何评估时的有效知识迁移。
  • 通过在高斯过程框架中联合建模超参数、数据表示和样本大小,提升超参数优化的收敛速度。
  • 证明利用所有历史评估结果(包括次优配置)可实现比基线方法(后者会丢弃此类数据)更优的初始超参数选择。

提出的方法

  • 使用分布嵌入(例如通过特征核)将训练数据集表示为再生核希尔伯特空间中的元素,以捕捉数据分布的结构特性。
  • 构建一个关于三个输入的联合高斯过程模型:超参数 θ、数据分布 P_XY 和样本大小 s,以实现在任务间的联合推断。
  • 使用数据分布之间的核化相似性度量来量化任务相似性,从而实现从源任务向新目标任务的信息迁移。
  • 将所有来自源任务的历史评估结果(包括非最优的超参数配置)纳入高斯过程模型,以提升泛化能力并减少探索。
  • 将框架适配为可扩展的超参数迁移学习方法,确保在函数评估次数上具有线性可扩展性。
  • 在联合输入空间上应用采集函数(例如期望改进)以顺序选择能最大化目标性能期望改进的超参数。

实验结果

研究问题

  • RQ1通过数据分布嵌入是否能通过在无目标任务初始评估的情况下实现跨任务知识迁移,从而改善超参数优化?
  • RQ2与标准贝叶斯优化相比,联合建模超参数、数据分布和样本大小在收敛速度上会产生何种影响?
  • RQ3手工设计的元特征在超参数迁移中的性能限制有多大?学习到的表示能否克服这些限制?
  • RQ4利用所有历史评估结果(包括次优配置)是否能实现比丢弃此类数据的方法更优的初始超参数选择?
  • RQ5所提方法是否能在对目标目标函数进行少数次评估后即实现接近最优的性能?

主要发现

  • 所提方法 distGP 在某些情况下可实现单次优化,仅需对目标目标函数进行一到两次评估即可识别最优超参数配置。
  • 在回归和分类任务中,distGP 显著优于多GP、initGP、manualBO 和 multiBO 等基线方法,在收敛速度上表现更优。
  • 在 Protein 数据集上,distGP 在 Jaccard 核 C-SVM 和随机森林任务中均实现了少样本最优,且收敛速度超过所有基线方法。
  • 该方法对无法通过边缘或成对统计量检测的任务差异(如协变量中的三重交互作用)表现出鲁棒性。
  • 依赖手工设计元特征的基线方法(如 manualBO)表现欠佳,因其特征对任务差异不敏感,导致性能与 multiBO 相当。
  • initGP 在冷启动后收敛缓慢,凸显了使用所有历史评估结果而非仅最优配置的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。