[论文解读] Transferable Neural Processes for Hyperparameter Optimization
该论文提出了一种端到端的超参数优化(HPO)方法——可迁移神经过程(TNP),通过从相关数据集的历史HPO试验中迁移知识,加速贝叶斯优化。TNP使用数据集感知注意力机制,动态加权相似数据集,学习可迁移的模型参数和初始超参数配置,在比基线方法少一个数量级的试验次数内实现最先进性能。
Automated machine learning aims to automate the whole process of machine learning, including model configuration. In this paper, we focus on automated hyperparameter optimization (HPO) based on sequential model-based optimization (SMBO). Though conventional SMBO algorithms work well when abundant HPO trials are available, they are far from satisfactory in practical applications where a trial on a huge dataset may be so costly that an optimal hyperparameter configuration is expected to return in as few trials as possible. Observing that human experts draw on their expertise in a machine learning model by trying configurations that once performed well on other datasets, we are inspired to speed up HPO by transferring knowledge from historical HPO trials on other datasets. We propose an end-to-end and efficient HPO algorithm named as Transfer Neural Processes (TNP), which achieves transfer learning by incorporating trials on other datasets, initializing the model with well-generalized parameters, and learning an initial set of hyperparameters to evaluate. Experiments on extensive OpenML datasets and three computer vision datasets show that the proposed model can achieve state-of-the-art performance in at least one order of magnitude less trials.
研究动机与目标
- 解决在试验次数极度受限的情况下,尤其是在昂贵的大规模数据集上进行超参数优化(HPO)的挑战。
- 克服传统SMBO方法因需要大量试验才能收敛而导致的低效问题。
- 通过利用相关数据集的历史试验,无需人工设计元特征,实现HPO中的有效迁移学习。
- 开发一种可扩展的端到端HPO框架,结合可迁移的模型初始化、自适应相似性建模和优化的初始配置。
- 通过学习表示动态评估数据集相似性,而非依赖手工设计的元特征,从而减少负迁移。
提出的方法
- TNP采用神经过程(NPs)作为代理模型,定义函数上的分布,结合神经网络的表达能力与高斯过程的不确定性量化能力。
- 该模型使用编码器将每个超参数-准确率观测值映射为潜在表示。
- 通过数据集感知的交叉注意力机制,利用聚合的观测表示计算目标数据集与历史数据集之间的相似性。
- 将注意力机制输出的潜在分布作为解码器的输入,用于预测新超参数配置的性能和不确定性。
- 采用元学习策略(受MAML启发)端到端训练模型,以学习代理模型参数的可迁移初始化。
- TNP通过学习到的可迁移先验,初始化SMBO,获得具有良好泛化能力的超参数配置集合,从而加速收敛。
实验结果
研究问题
- RQ1能否通过从相关数据集的历史HPO试验中迁移知识,显著减少找到最优超参数所需的试验次数?
- RQ2如何在不依赖手工设计元特征的情况下,有效建模数据集相似性?
- RQ3具有隐式核学习能力的神经过程代理模型,能否在多样化数据集上实现良好泛化并实现高效扩展?
- RQ4与单一来源迁移相比,同时迁移观测值、模型参数和初始配置是否能带来更优的HPO性能?
- RQ5当从不相似数据集迁移时,该模型如何减轻负迁移的影响?
主要发现
- TNP在OpenML数据集和计算机视觉基准(如CIFAR-10、SVHN和MNIST)上实现了最先进性能,所需试验次数比基线方法少一个数量级。
- 在CIFAR-10数据集上,TNP仅用10次试验即达到高分类准确率,甚至优于基于GP的方法和随机搜索。
- 消融实验证实,所有组件——数据集感知注意力、可迁移初始化和泛化初始配置——均显著提升了HPO性能。
- 该模型通过学习数据集间的相似性向量,有效避免了负迁移,对相关数据集(breast-w)的相似度得分为0.5439,对不相似数据集(mfeat-zernike)的相似度得分为0.1174。
- 无论用于生成历史观测的基线方法如何,TNP均保持强性能,表明其对噪声或次优先验数据具有鲁棒性。
- 当历史数据集数量超过50个时,性能略有下降,表明知识多样性与噪声累积之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。