[论文解读] Exploiting correlation and budget constraints in Bayesian multi-armed bandit optimization
本文提出了一种贝叶斯多臂老虎机方法用于固定预算下的最优臂识别,通过高斯过程建模臂之间的相关性,从而在高维、低预算的优化场景中实现更优性能,尤其适用于自动化机器学习领域;在臂的数量超过评估预算时,经典频率学派方法因无法适用而失效。
We address the problem of finding the maximizer of a nonlinear smooth function, that can only be evaluated point-wise, subject to constraints on the number of permitted function evaluations. This problem is also known as fixed-budget best arm identification in the multi-armed bandit literature. We introduce a Bayesian approach for this problem and show that it empirically outperforms both the existing frequentist counterpart and other Bayesian optimization methods. The Bayesian approach places emphasis on detailed modelling, including the modelling of correlations among the arms. As a result, it can perform well in situations where the number of arms is much larger than the number of allowed function evaluation, whereas the frequentist counterpart is inapplicable. This feature enables us to develop and deploy practical applications, such as automatic machine learning toolboxes. The paper presents comprehensive comparisons of the proposed approach, Thompson sampling, classical Bayesian optimization techniques, more recent Bayesian bandit approaches, and state-of-the-art best arm identification methods. This is the first comparison of many of these methods in the literature and allows us to examine the relative merits of their different features.
研究动机与目标
- 解决在函数评估昂贵且受限的固定预算设置下,识别最优配置(最优臂)的挑战。
- 克服频率学派最优臂识别方法(如UGap)的局限性,后者要求采样所有臂,因此在臂的数量超过预算时失效。
- 开发一种显式建模臂之间相关性的贝叶斯框架,以在严格评估约束下提升样本效率和推荐准确性。
- 实现在自动化机器学习等实际应用中的可部署性,其中超参数调优必须在严格限制的交叉验证轮次内完成。
- 证明贝叶斯方法可在理论保证上与频率学派方法相媲美,同时在高维、低预算场景中展现出更优的实证性能。
提出的方法
- 使用平方指数核的高斯过程对不同配置之间的奖励函数进行建模,以捕捉臂之间的相关性。
- 通过贝叶斯后验更新维护对真实函数值的信念,结合先验知识和观测数据以优化不确定性估计。
- 应用Thompson采样实现探索与利用的权衡,其中动作根据从后部分布中采样的函数值随机选择。
- 集成一种新颖的获取策略——BayesGap,其明确优化在预算结束时选择真实最优臂的概率,而非最小化累积损失。
- 从臂之间的核化相关性构建设计矩阵,并利用其计算每条臂的后验均值和方差,从而在不确定性下做出有根据的选择。
- 在每次臂拉动时执行10%训练集和10%验证集的交叉验证,将每个模型配置视为一条臂,并使用RMSE作为泛化误差的代理指标。
实验结果
研究问题
- RQ1当臂的数量超过评估预算时,是否一种建模臂之间相关性的贝叶斯方法能在固定预算优化中优于频率学派最优臂识别方法?
- RQ2在预算约束下,Thompson采样和BayesGap在最终推荐质量方面与经典贝叶斯优化方法(如期望改进)相比表现如何?
- RQ3在高维搜索空间中,建模臂之间的相关性在多大程度上能提升样本效率并降低收敛至局部最优的风险?
- RQ4贝叶斯方法是否能实现与频率学派方法(如Gabillon et al., 2012)相当的理论性能保证,同时保持更优的实证结果?
- RQ5在自动化机器学习中,当受限于固定数量的交叉验证运行时,所提出方法是否能比现有老虎机或优化技术生成更优的超参数配置?
主要发现
- 在预算较小(T=10)且臂的数量较大(160种模型)时,BayesGap和Thompson采样在最终推荐质量方面显著优于期望改进(EI)、概率改进(PI)和GP-UCB方法。
- EI和PI常陷入局部极小值——例如,反复选择rbfSVM,尽管其泛化误差较差——而BayesGap和Thompson采样能更有效地探索,避免次优收敛。
- 在固定预算T=10次评估下,BayesGap和Thompson采样在wine数据集上实现了比其他方法更低的中位数RMSE,表明其在最终模型选择性能上更优。
- 即使臂的数量(160)远超允许的评估次数(T=10),该方法依然有效,而频率学派方法(如UGap)因需采样所有臂而在该场景下不适用。
- Thompson采样由于内在的随机化表现出更均匀的探索行为,但BayesGap针对最终推荐质量的针对性优化使其更优地收敛至全局最优。
- 贝叶斯方法实现了与频率学派UGap方法相当的理论性能界,表明相关性建模与合理的先验可同时实现强大的理论与实证结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。