[论文解读] PASHA: Efficient HPO and NAS with Progressive Resource Allocation
PASHA 是一种用于高效超参数优化(HPO)和神经架构搜索(NAS)的渐进式资源分配方法,通过在调优过程中动态增加最大资源,降低计算成本,同时保持模型性能。在 WMT 等大规模数据集上,其速度相比 ASHA 最快提升 15.5 倍,且未牺牲准确性,在鲁棒性和效率方面优于固定预算方法和单周期基线方法。
Hyperparameter optimization (HPO) and neural architecture search (NAS) are methods of choice to obtain the best-in-class machine learning models, but in practice they can be costly to run. When models are trained on large datasets, tuning them with HPO or NAS rapidly becomes prohibitively expensive for practitioners, even when efficient multi-fidelity methods are employed. We propose an approach to tackle the challenge of tuning machine learning models trained on large datasets with limited computational resources. Our approach, named PASHA, extends ASHA and is able to dynamically allocate maximum resources for the tuning procedure depending on the need. The experimental comparison shows that PASHA identifies well-performing hyperparameter configurations and architectures while consuming significantly fewer computational resources than ASHA.
研究动机与目标
- 解决在计算资源有限的情况下,于大规模数据集上训练时 HPO 和 NAS 所带来的高计算成本问题。
- 改进现有如 ASHA 的多保真度方法,后者固定最大资源,可能无法充分利用早期性能信号。
- 开发一种基于观测性能动态分配资源的方法,以减少计算浪费。
- 为计算预算受限的实践者提供实用且成本效益高的 HPO 和 NAS 方法。
- 与样本高效策略(如贝叶斯优化)高效结合,以进一步提升性能。
提出的方法
- PASHA 通过在时间推移中逐步增加对有希望配置的资源分配上限,扩展了 ASHA 方法。
- 它从一个较小的初始最大资源水平开始,并随着早期评估中获得的更多信息逐步提升该上限。
- 该算法采用多保真度框架并结合逐次减半策略,但允许最大资源水平根据各层级间性能的稳定性而增长。
- 资源水平以训练步数或梯度更新次数定义,从而实现细粒度控制和适应性。
- PASHA 根据配置在连续层级间排名的稳定性来决定何时停止进一步分配资源。
- 它通过类似 BOHB 的设置与贝叶斯优化集成,结合样本效率与渐进式资源扩展。
实验结果
研究问题
- RQ1渐进式资源分配策略是否能在不降低最终模型性能的前提下,减少 HPO 和 NAS 的计算成本?
- RQ2与固定预算方法相比,动态调整最大资源如何影响配置搜索的速度与鲁棒性?
- RQ3PASHA 在识别高性能超参数或架构方面,相较于单周期基线和随机搜索,能实现多大程度的性能提升?
- RQ4在与贝叶斯优化结合时,PASHA 在准确性和效率方面表现如何?
- RQ5资源粒度和层级数量对 PASHA 在不同基准设置下的有效性有何影响?
主要发现
- 在 WMT 基准测试中,PASHA 相比 ASHA 实现了 15.5 倍的速度提升,运行时间从 43.7 小时减少至 2.8 小时,同时保持了具有竞争力的准确率(62.04% vs. 62.72%)。
- 在 ImageNet 上,PASHA 将运行时间从 ASHA 的 7.3 小时减少至 3.8 小时,达到 73.37% 的准确率,优于单周期基线(63.40%)
- 单周期基线在 ImageNet 上表现较差(63.40%),但在 WMT 上表现尚可(62.36%),表明其在不同数据集间缺乏鲁棒性。
- 随机搜索在 WMT 上表现显著差于所有其他方法,准确率仅为 33.93%,凸显了结构化搜索策略的必要性。
- PASHA 在多次运行中表现稳定,标准差较低(如 WMT 的 2.05),表明其配置选择具有一致性。
- 即使在资源层级较少的情况下,只要资源粒度较高,PASHA 依然有效,且在计算需求高的大规模数据集上速度提升最为显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。