[论文解读] A sequential Monte Carlo approach to Thompson sampling for Bayesian optimization
本文提出了一种基于顺序蒙特卡洛的算法,用于近似高斯过程最大值的分布,从而在连续输入空间中实现贝叶斯优化的汤普森采样,而无需优化非线性采集函数。该方法在累积遗憾方面表现出色,证明了其在风力涡轮机控制器等复杂系统在线、数据驱动调优中的有效性。
Bayesian optimization through Gaussian process regression is an effective method of optimizing an unknown function for which every measurement is expensive. It approximates the objective function and then recommends a new measurement point to try out. This recommendation is usually selected by optimizing a given acquisition function. After a sufficient number of measurements, a recommendation about the maximum is made. However, a key realization is that the maximum of a Gaussian process is not a deterministic point, but a random variable with a distribution of its own. This distribution cannot be calculated analytically. Our main contribution is an algorithm, inspired by sequential Monte Carlo samplers, that approximates this maximum distribution. Subsequently, by taking samples from this distribution, we enable Thompson sampling to be applied to (armed-bandit) optimization problems with a continuous input space. All this is done without requiring the optimization of a nonlinear acquisition function. Experiments have shown that the resulting optimization method has a competitive performance at keeping the cumulative regret limited.
研究动机与目标
- 解决传统采集函数在连续输入空间中计算成本高昂的问题,以实现高效的贝叶斯优化。
- 开发一种方法,用于近似高斯过程最大值分布,该分布在分析上难以处理。
- 通过从最大值分布中采样,实现在连续臂老虎机问题中的汤普森采样。
- 为昂贵且噪声较大的函数提供一种适合实际应用(如控制器调优)的遗憾最小化优化框架。
- 在累积遗憾方面,证明该方法与现有贝叶斯优化方法相比具有竞争力。
提出的方法
- 该方法使用顺序蒙特卡洛(SMC)采样,对输入空间上高斯过程最大值的分布进行近似。
- 粒子在迭代过程中被传播和重采样,以表示基于观测到的噪声函数评估结果的函数最大值后验分布。
- 由此产生的粒子近似使得汤普森采样成为可能,通过从估计的最大值分布中随机抽样来选择下一个评估点。
- 该方法通过直接从最大值分布中采样,避免了对非线性采集函数(如期望改进或改进概率)进行优化。
- 该算法被集成到贝叶斯优化循环中,每次新观测都会更新高斯过程后验分布和SMC近似。
- 该方法通过风力涡轮机控制器调优问题进行评估,性能通过多次优化运行的累积遗憾进行衡量。
实验结果
研究问题
- RQ1顺序蒙特卡洛方法是否能有效近似连续输入空间中高斯过程最大值的不可解析分布?
- RQ2能否通过基于粒子的最大值分布近似,有效应用于连续臂老虎机问题中的汤普森采样?
- RQ3与现有贝叶斯优化技术相比,该方法是否实现了具有竞争力的累积遗憾性能?
- RQ4该方法是否能在避免非线性采集函数优化计算负担的同时,保持优异的优化性能?
- RQ5在风力涡轮机控制器调优等真实世界高成本优化场景中,该方法表现如何?
主要发现
- 所提出的蒙特卡洛最大值分布(MCMD)算法成功使用顺序蒙特卡洛采样近似了高斯过程最大值的分布。
- 该方法在连续输入空间中实现了汤普森采样,而无需优化非线性采集函数,简化了下一个评估点的选择。
- 在风力涡轮机控制器调优实验中,该方法实现了与最先进贝叶斯优化算法相当的累积遗憾水平。
- 该算法在50次独立运行中表现出稳健性能,随时间推移始终实现一致的遗憾最小化。
- 粒子对最大值分布的近似在高维、噪声大且评估昂贵的优化问题中被证明是有效的。
- 结果表明,结合MCMD的汤普森采样是高不确定性与高成本评估系统中在线、数据驱动优化的一种可行且高效的选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。