[论文解读] PriorBand: Practical Hyperparameter Optimization in the Age of Deep Learning
PriorBand 是一种面向深度学习的实用超参数优化(HPO)方法,通过整合专家先验知识和廉价代理任务,实现了更高的效率和鲁棒性。它在多种深度学习基准测试中优于现有方法,展现出优异的即时性能,并对错误的专家信念具有强鲁棒性。
Hyperparameters of Deep Learning (DL) pipelines are crucial for their downstream performance. While a large number of methods for Hyperparameter Optimization (HPO) have been developed, their incurred costs are often untenable for modern DL. Consequently, manual experimentation is still the most prevalent approach to optimize hyperparameters, relying on the researcher's intuition, domain knowledge, and cheap preliminary explorations. To resolve this misalignment between HPO algorithms and DL researchers, we propose PriorBand, an HPO algorithm tailored to DL, able to utilize both expert beliefs and cheap proxy tasks. Empirically, we demonstrate PriorBand's efficiency across a range of DL benchmarks and show its gains under informative expert input and robustness against poor expert beliefs
研究动机与目标
- 解决现有HPO方法与现代深度学习实践之间的错位问题,后者在有限计算预算下要求高效率。
- 开发一种能有效利用专家知识和廉价代理评估的HPO算法,以加速超参数搜索。
- 在计算预算较低的情况下,对不准确的专家先验保持鲁棒性,同时维持强性能。
- 支持混合类型超参数空间(类别型、数值型、对数型),并实现高效的并行化。
- 提供一种简单、无需模型、模块化的HPO框架,易于在真实世界深度学习流程中理解和实现。
提出的方法
- PriorBand通过在超参数配置上引入专家提供的先验知识,扩展了类似HyperBand的多保真度HPO算法。
- 它采用分层的基于多臂赌博机的资源分配策略,优先考虑先验概率较高的配置,尤其是在早期低预算评估阶段。
- 该方法根据在廉价代理任务(如较小的数据集或更少的训练步数)上的表现,动态分配计算资源。
- PriorBand通过在超参数上定义先验分布来整合专家信念,用于指导初始采样和资源分配决策。
- 它通过避免为离散超参数设计复杂的代理模型或核函数,保持了无需模型的简洁性。
- 该算法支持异步和并行执行,可在现代硬件上实现高效扩展。
![Figure 1: Both plots compare Random Search (RS), sampling from prior (RS+Prior), HyperBand (HB), and our method PriorBand which utilizes a good prior as defined by an expert. [ Left ] Tuning a large transformer on the 1B word benchmark. PriorBand leverages the prior, achieving strong anytime perform](https://ar5iv.labs.arxiv.org/html/2306.12370/assets/x1.png)
实验结果
研究问题
- RQ1HPO方法能否有效结合专家先验知识和廉价代理任务,以提升深度学习中超参数优化的效率?
- RQ2与随机搜索、网格搜索或HyperBand等标准HPO基线相比,PriorBand在低计算预算下的表现如何?
- RQ3在真实世界深度学习场景中,PriorBand对不准确或误导性专家先验的鲁棒性如何?
- RQ4PriorBand在并行和异步计算环境中能实现多大程度的高效扩展?
- RQ5PriorBand能否灵活扩展以增强现有的多保真度和基于模型的HPO算法?
主要发现
- 在所有12个测试基准中,PriorBand均取得了最佳的最终验证误差,始终优于包括HyperBand、BO和Mobster在内的基线方法。
- 在PD1-LM1B基准上,PriorBand+BO的最终误差为 $0.630 /pm 0.018$,显著优于Mobster+ESP ($0.634 /pm 0.014$) 和 Mobster ($0.643 /pm 0.014$)。
- 在JAHS-C10上,借助良好的专家先验,PriorBand将最终误差从Mobster的 $12.192 /pm 1.558$ 降低至 $8.281 /pm 0.221$(PriorBand+BO)。
- 即使专家先验较差,PriorBand仍保持强劲性能,将PD1-ImageNet上的误差从Mobster的 $0.333 /pm 0.056$ 降低至 $0.328 /pm 0.035$(PriorBand)。
- 在5倍预算设置下,PriorBand+BO在PD1-ImageNet上的最终误差为 $0.249 /pm 0.025$,优于Mobster ($0.410 /pm 0.233$) 和 Mobster+ESP ($0.336 /pm 0.164$)。
- 该方法展现出强大的即时性能,即使在搜索早期阶段,PriorBand的表现也优于随机搜索和HyperBand。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。