[论文解读] Using a thousand optimization tasks to learn hyperparameter search strategies
本文提出了TaskSet,一个大规模、多样化的数据集,包含超过1,000个深度学习优化任务,涵盖图像分类、变分自编码器、归一化流和语言建模。通过在该数据集上元学习一个有序的超参数搜索列表,作者在随机搜索的基础上显著提升了样本效率,并在新任务(如ImageNet和LM1B)上展现出强大的泛化能力,同时发布了2900万条训练曲线和代码,以支持研究的可复现性。
We present TaskSet, a dataset of tasks for use in training and evaluating optimizers. TaskSet is unique in its size and diversity, containing over a thousand tasks ranging from image classification with fully connected or convolutional neural networks, to variational autoencoders, to non-volume preserving flows on a variety of datasets. As an example application of such a dataset we explore meta-learning an ordered list of hyperparameters to try sequentially. By learning this hyperparameter list from data generated using TaskSet we achieve large speedups in sample efficiency over random search. Next we use the diversity of the TaskSet and our method for learning hyperparameter lists to empirically explore the generalization of these lists to new optimization tasks in a variety of settings including ImageNet classification with Resnet50 and LM1B language modeling with transformers. As part of this work we have opensourced code for all tasks, as well as ~29 million training curves for these problems and the corresponding hyperparameters.
研究动机与目标
- 为解决当前缺乏大规模、多样化且与应用相关联的优化数据集的问题,以支持学习型优化器的训练与评估。
- 降低深度学习中超参数调优带来的高计算成本与环境负担。
- 开发一种数据驱动的、基于元学习的超参数搜索策略,使其在多样化任务间具备泛化能力。
- 通过学习最优的超参数配置序列,实现更高效、样本高效的超参数搜索。
- 发布一个全面的基准数据集、训练曲线和代码,以加速学习型优化器与超参数搜索领域的未来研究。
提出的方法
- 构建了TaskSet,一个包含超过1,000个深度学习优化任务的数据集,涵盖多样化的模型架构、数据集和超参数配置。
- 将一个任务定义为包含数据、损失函数和模型架构的完整训练流程,覆盖参数量7个数量级的范围。
- 利用元学习方法训练一个有序的超参数列表,以在TaskSet中的所有任务上实现最大性能。
- 采用基于固定超参数配置序列的搜索策略,该序列通过在TaskSet上的优化过程学习得到。
- 在4,000种不同的超参数配置下训练了约2900万个小批量模型,以学习最优列表。
- 以TensorFlow、JAX和PyTorch三种框架发布代码,同时提供所有训练曲线和超参数日志,供公众使用。
实验结果
研究问题
- RQ1一个单一的、学习得到的超参数搜索列表是否能在广泛范围的深度学习任务中实现泛化?
- RQ2与随机搜索相比,元学习得到的超参数排序在样本效率方面表现如何?
- RQ3在较小任务上学习得到的超参数列表,能在多大程度上泛化到大规模任务(如ImageNet和LM1B)?
- RQ4任务的多样性与规模对学习优化策略的性能与鲁棒性有何影响?
- RQ5不同优化器超参数(如初始学习率、权重衰减)在跨任务泛化中起到何种作用?
主要发现
- 与随机搜索相比,元学习得到的超参数列表在样本效率方面实现了显著提速,大幅减少了找到优质配置所需的尝试次数。
- 所学习的列表在新任务(如ImageNet上的ResNet50和LM1B上的基于Transformer的语言建模)上表现出有效的泛化能力。
- 具有相似架构和目标的任务(如VAEs、RNNs)在嵌入空间中聚集,表明其具有共享的优化动力学特性。
- TaskSet的多样性使得能够发现对不同模型类型和数据分布均具有鲁棒性的超参数策略。
- 2900万条训练曲线和超参数日志的发布,为未来元学习与超参数分析提供了宝贵资源。
- 开源代码库使得所学习的超参数列表可立即应用于新模型与新框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。