[论文解读] Automatic Termination for Hyperparameter Optimization
本文提出了一种用于超参数调优中贝叶斯优化的自动终止准则,当估计的遗憾值足够接近全局最优时停止优化过程,该方法使用高概率置信区间,并基于交叉验证方差的数据驱动阈值。该方法在保持高测试性能的同时减少了过拟合和计算量,适用于多种超参数优化基准测试。
Bayesian optimization (BO) is a widely popular approach for the hyperparameter optimization (HPO) in machine learning. At its core, BO iteratively evaluates promising configurations until a user-defined budget, such as wall-clock time or number of iterations, is exhausted. While the final performance after tuning heavily depends on the provided budget, it is hard to pre-specify an optimal value in advance. In this work, we propose an effective and intuitive termination criterion for BO that automatically stops the procedure if it is sufficiently close to the global optimum. Our key insight is that the discrepancy between the true objective (predictive performance on test data) and the computable target (validation performance) suggests stopping once the suboptimality in optimizing the target is dominated by the statistical estimation error. Across an extensive range of real-world HPO problems and baselines, we show that our termination criterion achieves a better trade-off between the test performance and optimization time. Additionally, we find that overfitting may occur in the context of HPO, which is arguably an overlooked problem in the literature, and show how our termination criterion helps to mitigate this phenomenon on both small and large datasets.
研究动机与目标
- 解决在贝叶斯超参数优化(HPO)中预设固定预算所带来的挑战,该问题可能导致次优性能或计算资源浪费。
- 识别并缓解HPO中的过拟合问题,即验证性能提升并不一定带来更好的测试性能。
- 开发一种直观、即插即用的终止准则,在减少优化时间的同时保持解决方案质量。
- 基于交叉验证的统计特性提供数据驱动的停止阈值,而非依赖于任意的固定值。
提出的方法
- 该方法使用简单遗憾(当前最优与全局最优之间的差异)的高概率上界来指导终止决策。
- 其终止阈值基于交叉验证估计器的方差,以考虑验证误差与测试误差之间的不可减少差距。
- 该准则动态评估进一步优化是否不太可能超出用户定义的容差范围带来显著改进。
- 该方法与任何基于贝叶斯优化的HPO方法兼容,可与Hyperband等现有加速技术结合使用。
- 该方法避免依赖固定迭代次数或启发式改进阈值,而是利用统计置信度来确定停止时机。
- 该方法实现为插件形式,可无缝集成到标准HPO流水线中,无需修改底层优化循环。
实验结果
研究问题
- RQ1能否为HPO中的贝叶斯优化设计一种自适应观测数据的自动终止准则,以避免过拟合?
- RQ2交叉验证的统计方差在多大程度上影响基于验证的停止决策的可靠性?
- RQ3基于交叉验证方差的数据驱动阈值是否能带来更好的优化时间与最终测试性能之间的权衡?
- RQ4即使使用交叉验证,HPO中过拟合现象在多大程度上仍然存在?自动终止能否有效缓解该问题?
- RQ5所提出的终止准则在不同HPO优化器和基准数据集上的鲁棒性如何?
主要发现
- 所提出的终止准则在真实遗憾值处于用户定义容差范围内的情况下,实现了80%至90%的成功停止率,确保了高解决方案质量。
- 该方法有效缓解了HPO中的过拟合问题,表现为正向的RYC分数,表明在终止时刻的测试性能优于后续轮次。
- 在HPO-Bench和NAS-Bench-201上,该方法在保持测试性能的同时显著减少了优化时间,优于基线方法。
- 该方法在不同HPO优化器(包括随机搜索和BORE)上表现出一致的性能,显示出强大的鲁棒性。
- 加速效果显著且稳定,与依赖固定迭代次数或收敛检测的基线方法相比,解决方案质量下降极小。
- 本研究揭示了即使在使用交叉验证的情况下,过拟合在HPO中仍是一个真实且被忽视的问题,而早期停止可有效预防该问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。