Skip to main content
QUICK REVIEW

[论文解读] YAHPO Gym -- An Efficient Multi-Objective Multi-Fidelity Benchmark for Hyperparameter Optimization

Florian Pfisterer, Lennart Schneider|arXiv (Cornell University)|Sep 8, 2021
Advanced Multi-Objective Optimization Algorithms被引用 9
一句话总结

YAHPO Gym 是一个基于代理模型的、多保真度的、多目标的超参数优化(HPO)基准库,包含14种不同的场景和700多个HPO问题。它表明,表格基准可能导致性能排名偏差,而其代理模型则能更真实、高效且准确地评估单目标和多目标设置下的HPO方法。

ABSTRACT

When developing and analyzing new hyperparameter optimization methods, it is vital to empirically evaluate and compare them on well-curated benchmark suites. In this work, we propose a new set of challenging and relevant benchmark problems motivated by desirable properties and requirements for such benchmarks. Our new surrogate-based benchmark collection consists of 14 scenarios that in total constitute over 700 multi-fidelity hyperparameter optimization problems, which all enable multi-objective hyperparameter optimization. Furthermore, we empirically compare surrogate-based benchmarks to the more widely-used tabular benchmarks, and demonstrate that the latter may produce unfaithful results regarding the performance ranking of HPO methods. We examine and compare our benchmark collection with respect to defined requirements and propose a single-objective as well as a multi-objective benchmark suite on which we compare 7 single-objective and 7 multi-objective optimizers in a benchmark experiment. Our software is available at [https://github.com/slds-lmu/yahpo_gym].

研究动机与目标

  • 解决当前缺乏标准化、高效且真实的HPO基准的问题,以反映现实世界中的挑战。
  • 证明基于表格的基准可能因基于网格的采样方式而在HPO方法的性能排名中引入偏差。
  • 开发一个基于代理模型的基准库,支持高质量、可扩展的多保真度和多目标HPO。
  • 提供一个统一、可扩展且面向社区的测试平台,用于在多样化的机器学习场景中评估和比较HPO算法。
  • 通过提供一个大规模、多样化且查询成本低廉的基准套件,支持元学习和元优化应用。

提出的方法

  • 该基准通过在14个不同场景中对机器学习流水线的预计算评估结果训练代理模型构建而成,每个场景涉及不同的算法和数据集。
  • 每个场景使用共享的搜索空间和性能指标,超参数配置在多个保真度级别上进行评估(例如,训练集大小从5%到100%)。
  • 代理模型基于通过高性能计算(9.8个CPU年)收集的数据进行拟合,利用重采样技术实现在不同训练集比例下的多保真度评估。
  • 该库支持单目标和多目标优化,提供通过标准化API访问的版本化代理模型集合。
  • 该基准包含条件超参数(例如,在超学习器场景中),并与现有的机器学习流水线和HPO工具包集成。
  • 该基准以Apache 2.0许可证发布,并托管在GitHub上,附带全面的文档。

实验结果

研究问题

  • RQ1与更真实的基于代理模型的基准相比,依赖预定义网格的表格基准是否会导致HPO方法性能排名产生偏差?
  • RQ2基于代理模型的基准是否能更真实、更具代表性地评估多样化的搜索空间和目标下的HPO方法?
  • RQ3不同HPO方法在支持多保真度和多目标优化的大规模、多样化且真实的基准套件中表现如何?
  • RQ4代理模型在真实HPO场景中对真实目标景观的近似程度在多大程度上是准确的?
  • RQ5所提出的基准套件在支持需要大量评估和多样化问题实例的元学习和元优化应用方面,是否具备可行性?

主要发现

  • 由于依赖固定且预计算的网格,表格基准在HPO方法的性能排名中引入了显著偏差,这改变了底层的优化问题。
  • 像YAHPO Gym这样的基于代理模型的基准能提供更真实可靠的性能估计,并更准确地反映HPO方法在单目标和多目标设置下的真实排名。
  • YAHPO Gym中的代理模型通过在全部14个场景中进行的广泛评估,验证了其对真实目标景观的高质量近似。
  • 该基准套件包含超过700个多保真度、多目标的HPO问题,源自14个不同的机器学习场景,每个场景具有多样化的搜索空间和数据集。
  • 该库支持HPO方法的高效、可扩展且可复现的评估,整个基准套件共评估了545万个配置。
  • YAHPO Gym支持高级HPO工作负载,包括条件超参数和多保真度评估,使其适用于元学习和元优化应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。