[论文解读] Optimizer Benchmarking Needs to Account for Hyperparameter Tuning
本文主张在优化器基准测试中必须考虑超参数调优的计算成本,提出一种通过在多样化任务中使用自动化超参数优化来实现公平评估的框架。结果表明,Adam优化器,尤其是仅进行学习率调优时,由于其鲁棒性和易调优性,在低预算场景下甚至优于经过充分调优的SGD变体,是最具实用性的选择。
The performance of optimizers, particularly in deep learning, depends considerably on their chosen hyperparameter configuration. The efficacy of optimizers is often studied under near-optimal problem-specific hyperparameters, and finding these settings may be prohibitively costly for practitioners. In this work, we argue that a fair assessment of optimizers' performance must take the computational cost of hyperparameter tuning into account, i.e., how easy it is to find good hyperparameter configurations using an automatic hyperparameter search. Evaluating a variety of optimizers on an extensive set of standard datasets and architectures, our results indicate that Adam is the most practical solution, particularly in low-budget scenarios.
研究动机与目标
- 解决由于人工选择超参数和调优工作量带来的优化器基准测试不公平问题。
- 评估在有限计算预算下,优化器在超参数搜索中实现良好性能的难易程度。
- 不仅从峰值性能角度,还从可调优性和鲁棒性角度,比较自适应优化器(如Adam)与非自适应优化器(如SGD变体)。
- 倡导在基准测试中纳入超参数优化成本,以反映工业和研究应用中的实际可行性。
- 提供一种标准化、自动化的基准测试协议,最大限度减少人工在超参数空间和搜索配置选择上的偏差。
提出的方法
- 在涵盖视觉、自然语言处理、回归和分类的9项多样化深度学习任务中开展基准测试。
- 使用固定搜索预算的自动化超参数优化(HPO)来评估优化器性能,避免人工调优。
- 使用单变量分布族对超参数空间进行先验分布估计,以减少人工在搜索空间定义上的偏差。
- 在不同HPO预算下比较优化器表现:从最小(仅学习率)到完整(所有超参数)。
- 采用概率性能度量评估在给定预算内找到高性能配置的可能性。
- 提出并评估“有效学习率”概念,以在低预算设置下提升性能,捕捉历史上$(\gamma,\mu)$组合的成功模式。
实验结果
研究问题
- RQ1当将超参数调优成本纳入基准测试时,优化器的性能如何变化?
- RQ2在超参数搜索计算预算较低的情况下,哪种优化器最具鲁棒性和实用性?
- RQ3仅调优学习率是否足以实现接近最优的性能,还是必须进行完整的超参数调优?
- RQ4自适应优化器(如Adam)与非自适应SGD变体在可调优性和性能稳定性方面有何差异?
- RQ5复杂的超参数交互作用在多大程度上影响了不同搜索预算下优化器性能的可靠性?
主要发现
- Adam在极少调优工作量下持续表现出高性能,尤其在仅优化学习率时,使其在低预算场景下成为最具实用性的选择。
- 仅调优Adam的学习率即可在高预算下实现与最佳结果相差2-3%的性能,表现出极高的可靠性。
- SGD变体在某些任务中可达到峰值性能,但需要大量调优,导致超参数空间中存在狭窄且难以触及的极小值区域。
- 对Adam进行完整超参数调优可进一步提升性能,但存在高方差,表明其超参数空间更不平滑、更复杂。
- Adam的超参数表面比SGD更宽广、更具鲁棒性,支持了自适应方法更易调优的假设。
- 使用“有效学习率”概念可通过利用历史上成功的$(\gamma,\mu)$组合,在低预算设置下提升性能,表明未来HPO框架中更优的先验建模具有潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。