Skip to main content
QUICK REVIEW

[论文解读] Bayesian Optimization With Censored Response Data

Matricon, Théo, Holger H. Hoos|arXiv (Cornell University)|Oct 7, 2013
Machine Learning and Algorithms参考文献 20被引用 22
一句话总结

该论文提出了一种贝叶斯优化框架,通过将新型期望最大化(EM)类型算法整合到随机森林中以填补右删失响应数据(即仅观测到函数值的下界),从而处理右删失数据。该方法实现了算法配置中的自适应删失,显著减少了昂贵的评估次数,使SMAC的性能得到提升,在真实世界求解器配置中,中位测试运行时间最高提升了126倍。

ABSTRACT

Bayesian optimization (BO) aims to minimize a given blackbox function using a model that is updated whenever new evidence about the function becomes available. Here, we address the problem of BO under partially right-censored response data, where in some evaluations we only obtain a lower bound on the function value. The ability to handle such response data allows us to adaptively censor costly function evaluations in minimization problems where the cost of a function evaluation corresponds to the function value. One important application giving rise to such censored data is the runtime-minimizing variant of the algorithm configuration problem: finding settings of a given parametric algorithm that minimize the runtime required for solving problem instances from a given distribution. We demonstrate that terminating slow algorithm runs prematurely and handling the resulting right-censored observations can substantially improve the state of the art in model-based algorithm configuration.

研究动机与目标

  • 解决函数评估成本等于函数值的代价可变黑箱优化问题,实现资源感知的最小化。
  • 在贝叶斯优化中处理右删失数据,即由于提前终止仅能观测到函数值的下界。
  • 通过整合因提前终止而产生的删失观测结果,改进基于模型的算法配置(AC)。
  • 开发一种实用且可扩展的方法,以处理算法配置中典型的高维离散输入。
  • 证明自适应删失在真实世界配置场景中可带来显著的性能提升。

提出的方法

  • 提出一种代价单调的优化框架,其中代价 c(θ) = f(θ),支持通过提前终止节省资源。
  • 引入一种EM类型算法,通过从截断正态分布中抽样,迭代地插补删失值。
  • 使用分层抽样为每个删失数据点生成多个插补值,以保留模型预测中的不确定性。
  • 通过在未删失数据上拟合树,并结合插补的删失值迭代重新训练,使随机森林能够处理删失数据。
  • 采用基于自助抽样的重抽样策略,以在各棵树中保持数据点的频率,并追踪重抽样次数以支持插补。
  • 将删失模型集成到SMAC(最先进的算法配置工具)中,通过松弛因子自适应设置删失阈值。

实验结果

研究问题

  • RQ1贝叶斯优化能否有效处理仅观测到函数值下界的右删失响应数据?
  • RQ2如何建模删失数据,以保留不确定性并支持优化中的主动学习?
  • RQ3自适应删失(即提前终止慢速运行并使用下界)是否能提升基于模型的算法配置效率?
  • RQ4所提出的插补方法在算法配置中常见的高维离散输入空间中是否优于标准方法?
  • RQ5实践中删失阈值的最优松弛因子是什么?其对模型性能和运行效率有何影响?

主要发现

  • 在全部7个真实世界配置场景中,引入删失的改进版SMAC均优于原始版本,其中4个场景具有统计显著性。
  • 在SPEAR-SWV问题上,使用删失的最佳配置实现的中位测试运行时间比非删失基线最高降低126倍。
  • 采用松弛因子1.3的删失策略在所有场景中均取得最佳整体性能,平衡了模型拟合与数据获取成本。
  • 在SPEAR-IBM基准测试中,所有包含删失的配置均达到相同的中位性能(1.36×10⁴秒),表明对高方差具有鲁棒性。
  • 该方法显著减少了完整评估的次数,尤其在高运行时间配置(如CPLEX12-CORLAT和SPEAR-SWV)中收益最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。