[论文解读] Fair and Green Hyperparameter Optimization via Multi-objective and Multiple Information Source Bayesian Optimization
该论文提出 FanG-HPO,一种多目标、多信息源的贝叶斯优化框架,通过使用小数据子集近似准确率与公平性,加速了公平且绿色的超参数优化。与标准多目标贝叶斯优化相比,该方法在显著减少查询次数的同时,实现了帕累托效率模型,降低了计算成本与能耗,且在基准公平性数据集上未牺牲模型质量。
There is a consensus that focusing only on accuracy in searching for optimal machine learning models amplifies biases contained in the data, leading to unfair predictions and decision supports. Recently, multi-objective hyperparameter optimization has been proposed to search for machine learning models which offer equally Pareto-efficient trade-offs between accuracy and fairness. Although these approaches proved to be more versatile than fairness-aware machine learning algorithms -- which optimize accuracy constrained to some threshold on fairness -- they could drastically increase the energy consumption in the case of large datasets. In this paper we propose FanG-HPO, a Fair and Green Hyperparameter Optimization (HPO) approach based on both multi-objective and multiple information source Bayesian optimization. FanG-HPO uses subsets of the large dataset (aka information sources) to obtain cheap approximations of both accuracy and fairness, and multi-objective Bayesian Optimization to efficiently identify Pareto-efficient machine learning models. Experiments consider two benchmark (fairness) datasets and two machine learning algorithms (XGBoost and Multi-Layer Perceptron), and provide an assessment of FanG-HPO against both fairness-aware machine learning algorithms and hyperparameter optimization via a multi-objective single-source optimization algorithm in BoTorch, a state-of-the-art platform for Bayesian Optimization.
研究动机与目标
- 解决机器学习超参数优化中公平性与能效的双重挑战。
- 降低公平机器学习模型超参数调优的计算与环境成本。
- 开发一种方法,在最小化模型训练与验证查询次数的同时,保持高质量的帕累托前沿。
- 在大规模数据集上评估准确率、公平性与查询效率之间的权衡。
- 将 FanG-HPO 的性能与公平性感知的机器学习算法及 BoTorch 中的单源多目标贝叶斯优化进行对比。
提出的方法
- 通过从大规模数据集中采样小而具代表性的子集,FanG-HPO 利用多个信息源来近似准确率与公平性度量。
- 采用多目标贝叶斯优化联合优化准确率与公平性,将两个目标建模为具有高斯过程的随机过程。
- 设计了两阶段采集函数,以在多个信息源之间平衡探索与利用,选择最具信息量的查询。
- 根据不确定性与期望改进动态分配查询至各信息源,以最小化总查询成本。
- 框架集成成本感知建模,其中查询成本取决于数据子集大小,从而实现节能优化。
- 帕累托前沿基于全数据集上的真实评估构建,而优化过程则在近似的信息源上执行。
实验结果
研究问题
- RQ1多信息源贝叶斯优化是否能在不牺牲模型质量的前提下,降低公平机器学习多目标超参数优化中的查询成本?
- RQ2与单源多目标贝叶斯优化(如 BoTorch)相比,FanG-HPO 在帕累托前沿质量与查询效率方面表现如何?
- RQ3FanG-HPO 在识别帕累托高效模型方面,能在多大程度上优于公平性感知的机器学习算法(如 zlrm、fgrrm)?
- RQ4使用数据子集是否能显著降低超参数调优中的能耗,同时保持公平性与准确率?
- RQ5FanG-HPO 在不同机器学习模型(如 XGBoost 与 MLP)和公平性数据集(ADULT、COMPAS)上的性能表现如何?
主要发现
- FanG-HPO 实现的帕累托前沿在超体积上与基于 BoTorch 的多目标优化相当,但在全数据集上的查询次数显著减少。
- 在 ADULT 与 COMPAS 数据集上,FanG-HPO 均减少了识别高质量帕累托解所需的全数据集查询次数,尤其在 MLP 模型上表现更优。
- 通过 FanG-HPO 优化的 XGBoost 模型在帕累托意义上主导了大多数 MLP 模型与公平性感知算法模型,实现了更优的准确率与公平性权衡。
- FanG-HPO 识别出的模型在帕累托意义上优于或与 zlrm 和 fgrrm 的结果相当,尤其在 ADULT 数据集上,其帕累托效率甚至优于公平性感知算法。
- 各信息源的查询次数因数据集与模型而异,FanG-HPO 将更多查询分配给更小但信息量更高的子集,体现了自适应采样特性。
- 该框架表明,使用多个数据子集可在降低能耗与二氧化碳排放的同时,高效探索超参数空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。