Skip to main content
QUICK REVIEW

[论文解读] Fair and Green Hyperparameter Optimization via Multi-objective and Multiple Information Source Bayesian Optimization

Antonio Candelieri, Andrea Ponti|arXiv (Cornell University)|May 18, 2022
Advanced Multi-Objective Optimization Algorithms被引用 5
一句话总结

该论文提出 FanG-HPO,一种多目标、多信息源的贝叶斯优化框架,通过使用小数据子集近似准确率与公平性,加速了公平且绿色的超参数优化。与标准多目标贝叶斯优化相比,该方法在显著减少查询次数的同时,实现了帕累托效率模型,降低了计算成本与能耗,且在基准公平性数据集上未牺牲模型质量。

ABSTRACT

There is a consensus that focusing only on accuracy in searching for optimal machine learning models amplifies biases contained in the data, leading to unfair predictions and decision supports. Recently, multi-objective hyperparameter optimization has been proposed to search for machine learning models which offer equally Pareto-efficient trade-offs between accuracy and fairness. Although these approaches proved to be more versatile than fairness-aware machine learning algorithms -- which optimize accuracy constrained to some threshold on fairness -- they could drastically increase the energy consumption in the case of large datasets. In this paper we propose FanG-HPO, a Fair and Green Hyperparameter Optimization (HPO) approach based on both multi-objective and multiple information source Bayesian optimization. FanG-HPO uses subsets of the large dataset (aka information sources) to obtain cheap approximations of both accuracy and fairness, and multi-objective Bayesian Optimization to efficiently identify Pareto-efficient machine learning models. Experiments consider two benchmark (fairness) datasets and two machine learning algorithms (XGBoost and Multi-Layer Perceptron), and provide an assessment of FanG-HPO against both fairness-aware machine learning algorithms and hyperparameter optimization via a multi-objective single-source optimization algorithm in BoTorch, a state-of-the-art platform for Bayesian Optimization.

研究动机与目标

  • 解决机器学习超参数优化中公平性与能效的双重挑战。
  • 降低公平机器学习模型超参数调优的计算与环境成本。
  • 开发一种方法,在最小化模型训练与验证查询次数的同时,保持高质量的帕累托前沿。
  • 在大规模数据集上评估准确率、公平性与查询效率之间的权衡。
  • 将 FanG-HPO 的性能与公平性感知的机器学习算法及 BoTorch 中的单源多目标贝叶斯优化进行对比。

提出的方法

  • 通过从大规模数据集中采样小而具代表性的子集,FanG-HPO 利用多个信息源来近似准确率与公平性度量。
  • 采用多目标贝叶斯优化联合优化准确率与公平性,将两个目标建模为具有高斯过程的随机过程。
  • 设计了两阶段采集函数,以在多个信息源之间平衡探索与利用,选择最具信息量的查询。
  • 根据不确定性与期望改进动态分配查询至各信息源,以最小化总查询成本。
  • 框架集成成本感知建模,其中查询成本取决于数据子集大小,从而实现节能优化。
  • 帕累托前沿基于全数据集上的真实评估构建,而优化过程则在近似的信息源上执行。

实验结果

研究问题

  • RQ1多信息源贝叶斯优化是否能在不牺牲模型质量的前提下,降低公平机器学习多目标超参数优化中的查询成本?
  • RQ2与单源多目标贝叶斯优化(如 BoTorch)相比,FanG-HPO 在帕累托前沿质量与查询效率方面表现如何?
  • RQ3FanG-HPO 在识别帕累托高效模型方面,能在多大程度上优于公平性感知的机器学习算法(如 zlrm、fgrrm)?
  • RQ4使用数据子集是否能显著降低超参数调优中的能耗,同时保持公平性与准确率?
  • RQ5FanG-HPO 在不同机器学习模型(如 XGBoost 与 MLP)和公平性数据集(ADULT、COMPAS)上的性能表现如何?

主要发现

  • FanG-HPO 实现的帕累托前沿在超体积上与基于 BoTorch 的多目标优化相当,但在全数据集上的查询次数显著减少。
  • 在 ADULT 与 COMPAS 数据集上,FanG-HPO 均减少了识别高质量帕累托解所需的全数据集查询次数,尤其在 MLP 模型上表现更优。
  • 通过 FanG-HPO 优化的 XGBoost 模型在帕累托意义上主导了大多数 MLP 模型与公平性感知算法模型,实现了更优的准确率与公平性权衡。
  • FanG-HPO 识别出的模型在帕累托意义上优于或与 zlrm 和 fgrrm 的结果相当,尤其在 ADULT 数据集上,其帕累托效率甚至优于公平性感知算法。
  • 各信息源的查询次数因数据集与模型而异,FanG-HPO 将更多查询分配给更小但信息量更高的子集,体现了自适应采样特性。
  • 该框架表明,使用多个数据子集可在降低能耗与二氧化碳排放的同时,高效探索超参数空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。