[论文解读] Learning to Transfer Initializations for Bayesian Hyperparameter Optimization.
本文提出一种元学习方法,通过将相似数据集上成功的超参数配置迁移到新数据集,以加速贝叶斯超参数优化。通过使用孪生CNN-LSTM网络学习数据集相似性的元特征,该方法选择相关的历史配置作为初始化,显著减少了在新数据集上的验证评估次数,尤其在图像分类任务的深度残差网络中效果显著。
Hyperparameter optimization undergoes extensive evaluations of validation errors in order to find the best configuration of hyperparameters. Bayesian optimization is now popular for hyperparameter optimization, since it reduces the number of validation error evaluations required. Suppose that we are given a collection of datasets on which hyperparameters are already tuned by either humans with domain expertise or extensive trials of cross-validation. When a model is applied to a new dataset, it is desirable to let Bayesian hyperparameter optimzation start from configurations that were successful on similar datasets. To this end, we construct a Siamese network with convolutional layers followed by bi-directional LSTM layers, to learn {\em meta-features} over datasets. Learned meta-features are used to select a few datasets that are similar to the new dataset, so that a set of configurations in similar datasets is adopted as initializations for Bayesian hyperparameter optimization. Experiments on image datasets demonstrate that our learned meta-features are useful in optimizing several hyperparameters in deep residual networks for image classification.
研究动机与目标
- 减少在新数据集上进行贝叶斯超参数优化所需的验证误差评估次数。
- 利用来自相似数据集的先前调优超参数作为有效的初始化。
- 学习能够捕捉数据集相似性的有意义元特征,以支持超参数调优中的迁移学习。
- 通过基于数据集相似性的相关历史配置选择,提升优化效率。
- 在使用深度残差网络的图像分类任务中验证该方法的有效性。
提出的方法
- 训练一个带有卷积层和双向LSTM层的孪生神经网络,以从数据集中学习元特征。
- 从数据集中提取元特征,以表示其内在特性并用于比较。
- 利用学习到的元特征计算新数据集与先前调优数据集之间的相似性。
- 选择与新数据集最相似的前k个数据集,以检索其先前优化的超参数配置。
- 将检索到的配置用作新数据集上贝叶斯优化的初始化。
- 该方法实现了无需从头开始训练即可在数据集间高效迁移超参数知识。
实验结果
研究问题
- RQ1学习到的元特征能否有效识别与新目标数据集相似的数据集,以实现超参数迁移?
- RQ2使用来自相似数据集的配置进行初始化,是否能减少所需验证评估的次数?
- RQ3与随机或非迁移基初始化策略相比,该方法在优化效率方面表现如何?
- RQ4由深度网络学习的元特征在不同图像分类任务之间具有多大程度的泛化能力?
- RQ5该方法在深度残差网络等复杂模型的多超参数场景下是否具备可扩展性?
主要发现
- 所提出方法显著减少了在新数据集上进行超参数优化所需的验证误差评估次数。
- 通过孪生CNN-LSTM架构学习到的元特征能有效捕捉数据集相似性,从而准确检索相关的历史配置。
- 使用来自相似数据集的配置进行初始化,相比随机或默认初始化,能显著加快贝叶斯优化的收敛速度。
- 在优化深度残差网络时,该方法在多个图像分类数据集上均表现出一致的性能提升。
- 元学习器中使用双向LSTM有助于建模数据集表征中的长距离依赖关系,从而提升迁移性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。