[论文解读] Automated Machine Learning with Monte-Carlo Tree Search
该论文提出 Mosaic,一种新颖的 AutoML 框架,结合蒙特卡洛树搜索(MCTS)进行结构化流水线优化与贝叶斯优化进行超参数调优,使用共享的代理模型。Mosaic 在 OpenML-100 基准测试中相较于 Auto-Sklearn 实现了统计上显著的性能提升,尤其在其 Vanilla 和 Ensemble 变体中表现突出,展示了在昂贵黑箱 AutoML 环境下更优的探索与优化效率。
The AutoML task consists of selecting the proper algorithm in a machine learning portfolio, and its hyperparameter values, in order to deliver the best performance on the dataset at hand. Mosaic, a Monte-Carlo tree search (MCTS) based approach, is presented to handle the AutoML hybrid structural and parametric expensive black-box optimization problem. Extensive empirical studies are conducted to independently assess and compare: i) the optimization processes based on Bayesian optimization or MCTS; ii) its warm-start initialization; iii) the ensembling of the solutions gathered along the search. Mosaic is assessed on the OpenML 100 benchmark and the Scikit-learn portfolio, with statistically significant gains over Auto-Sklearn, winner of former international AutoML challenges.
研究动机与目标
- 解决自动化机器学习(AutoML)作为具有昂贵评估的混合结构与参数黑箱优化问题的挑战。
- 通过结合 MCTS 进行流水线架构搜索与贝叶斯优化进行超参数调优,改进现有 AutoML 系统。
- 评估 Mosaic 的耦合优化策略相较于 SOTA 基线(如 Auto-Sklearn 和 Tpot)的有效性。
- 研究预热初始化、集成策略以及代理模型使用对 AutoML 性能的影响。
- 评估 Mosaic 超参数在多样化数据集上的鲁棒性与敏感性。
提出的方法
- Mosaic 使用蒙特卡洛树搜索(MCTS)探索机器学习流水线的结构空间,将流水线配置视为一个序列决策过程。
- 在每个 MCTS 节点,代理模型估计该节点下所有可能流水线完成路径的预期性能,指导树的扩展。
- 在模拟过程中,贝叶斯优化用于为给定流水线配置选择最优超参数,利用相同的代理模型。
- 代理模型持续根据新评估结果更新,并用于指导探索(MCTS)与局部搜索(贝叶斯优化)。
- Mosaic 支持多种变体:Vanilla(纯 MCTS)、MetaLearning(从预计算档案中进行预热初始化)和 Ensemble(聚合搜索中发现的解决方案)。
- 该方法在 OpenML-100 基准上使用 Scikit-learn 流水线组合进行评估,性能通过平均排名与显著性检验衡量。
实验结果
研究问题
- RQ1通过共享代理模型结合 MCTS 与贝叶斯优化,是否能带来优于单独使用任一方法的 AutoML 性能?
- RQ2Mosaic 的探索策略在 OpenML-100 基准上与 Auto-Sklearn 相比,在效率与性能提升方面如何?
- RQ3通过 MetaLearning 进行的预热初始化在多大程度上提升了 Mosaic 的性能,尤其是在大规模数据集上?
- RQ4Mosaic 的性能对超参数(如探索系数 $C_{ucb}$ 与模拟次数 $n_s$)的敏感性如何?
- RQ5结合搜索过程中发现的多个配置的集成策略,能否进一步提升泛化能力与鲁棒性?
主要发现
- Mosaic 的 Vanilla 与 Ensemble 变体在 OpenML-100 基准上相较于 Auto-Sklearn 实现了统计上显著的性能提升,所有数据集的平均排名均更低。
- MetaLearning 变体相较于 Auto-Sklearn 的增益较小,因为大部分优化时间被用于初始化,尤其在具有 1 小时时间限制的大规模数据集上。
- Mosaic 展现出比 Auto-Sklearn 更全面的探索策略,后者往往停留在初始配置附近,导致难以发现高性能流水线。
- 敏感性分析表明,Mosaic 的性能对 $C_{ucb}$ 与 $n_s$ 的变化具有鲁棒性,30 种超参数组合中有 24 种表现优于 Auto-Sklearn。
- 代理模型在 MCTS 与贝叶斯优化之间有效共享,实现了无需单独训练模型的协同探索与利用。
- Mosaic 在平均排名方面始终优于 Auto-Sklearn,最显著的改进出现在搜索过程的早期至中期阶段。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。