Skip to main content
QUICK REVIEW

[论文解读] Parallel Multi-Objective Hyperparameter Optimization with Uniform Normalization and Bounded Objectives

Romain Égelé, Tyler H. Chang|arXiv (Cornell University)|Sep 26, 2023
Advanced Multi-Objective Optimization AlgorithmsComputer Science被引用 3
一句话总结

该论文提出D-MoBO,一种并行多目标贝叶斯优化框架,采用均匀分位数归一化和软惩罚机制,以提升超参数调优中的收敛速度与解的质量。在16倍更多工作者的情况下实现5倍加速,并在基准任务中优于NSGA-II和MoTPE,尤其在早期收敛和超体积指标得分方面表现更优。

ABSTRACT

Machine learning (ML) methods offer a wide range of configurable hyperparameters that have a significant influence on their performance. While accuracy is a commonly used performance objective, in many settings, it is not sufficient. Optimizing the ML models with respect to multiple objectives such as accuracy, confidence, fairness, calibration, privacy, latency, and memory consumption is becoming crucial. To that end, hyperparameter optimization, the approach to systematically optimize the hyperparameters, which is already challenging for a single objective, is even more challenging for multiple objectives. In addition, the differences in objective scales, the failures, and the presence of outlier values in objectives make the problem even harder. We propose a multi-objective Bayesian optimization (MoBO) algorithm that addresses these problems through uniform objective normalization and randomized weights in scalarization. We increase the efficiency of our approach by imposing constraints on the objective to avoid exploring unnecessary configurations (e.g., insufficient accuracy). Finally, we leverage an approach to parallelize the MoBO which results in a 5x speed-up when using 16x more workers.

研究动机与目标

  • 为解决多目标超参数优化(MOHPO)中的挑战,包括目标尺度差异、对异常值的敏感性以及对无趣权衡的低效探索。
  • 提升基于模型的MOHPO中迭代效率与解的多样性,尤其针对机器学习工作流中常见的昂贵黑箱函数。
  • 实现MOHPO的有效并行化,可随计算资源扩展,避免高斯过程方法中常见的性能饱和问题。
  • 通过在用户定义的目标范围内对配置施加软惩罚,确保仅探索高质量、可行的权衡。
  • 在真实世界机器学习基准上,相比NSGA-II和MoTPE等现有方法,在收敛速度和最终解质量方面均表现更优。

提出的方法

  • 使用分位数均匀归一化(QU)对目标进行重标度,增强对帕累托前沿的关注,并提升对异常值的鲁棒性。
  • 应用软惩罚函数,以抑制目标值超出用户定义可行范围的配置的探索。
  • 通过均匀采样权重的随机标量化方法,促进帕累托前沿上搜索的多样性。
  • 利用随机森林代理模型高效建模多目标景观,并指导获取策略。
  • 通过共享队列和工作者协调机制,实现去中心化的并行配置评估,提升可扩展性。
  • 实施有界标量化方法,将搜索限制在指定兴趣范围内的权衡中。

实验结果

研究问题

  • RQ1均匀分位数归一化能否提升多目标贝叶斯优化在超参数调优中的鲁棒性与收敛性?
  • RQ2对不可行或无趣的目标权衡施加软惩罚函数,如何影响MOHPO的效率与质量?
  • RQ3并行化在多目标贝叶斯优化中的性能提升程度如何,特别是在加速比与解质量方面?
  • RQ4D-MoBO在多样化机器学习基准上与NSGA-II和MoTPE等成熟基线相比,在超体积和收敛速度方面表现如何?
  • RQ5所提方法在并行工作者数量增加时是否能有效扩展,能否在不出现性能饱和的情况下保持性能增益?

主要发现

  • 使用16倍更多工作者时,D-MoBO实现5倍收敛加速,在640张GPU上30分钟内达到40名工作者的解。
  • 在640名工作者下,D-MoBO的超体积指标(HVI)为0.66,显著优于NSGA-II(0.66)和MoTPE(0.26)在同一规模下的表现。
  • D-MoBO在640名工作者下的HVI曲线下方面积(AUC)为0.51,超过NSGA-II(0.45)、MoTPE(0.23)和随机搜索(0.13)。
  • 软惩罚机制减少了对无趣配置的探索,提升了效率——D-MoBO NP(无惩罚)在640名工作者下HVI为0.51,低于D-MoBO的0.66。
  • 随机搜索在并行度提升时性能增益极小,在640名工作者下完成30次评估,但HVI仅为0.21,表明可扩展性差。
  • D-MoBO在所有工作者数量下均持续优于所有竞争方法,尤其在早期收敛阶段性能差距最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。