Skip to main content
QUICK REVIEW

[论文解读] Efficient nonmyopic Bayesian optimization and quadrature.

Shali Jiang, Henry Chai|arXiv (Cornell University)|Sep 10, 2019
Machine Learning and Algorithms参考文献 34被引用 5
一句话总结

本文提出了一种非贪心的贝叶斯优化与积分框架,通过计算最优批次点并从中选择一点来改进决策,避免了贪心方法带来的次优权衡。该方法在贝叶斯优化与积分任务中均优于标准的一步-ahead近似方法。

ABSTRACT

Finite-horizon sequential decision problems arise naturally in many machine learning contexts; examples include Bayesian optimization and Bayesian quadrature. Computing the optimal policy for such problems requires solving Bellman equations, which are generally intractable. Most existing work resorts to myopic approximations by limiting the horizon to only a single time-step, which can perform poorly in balancing exploration and exploitation. We propose a general framework for efficient, nonmyopic approximation of the optimal policy by drawing a connection between the optimal adaptive policy and its non-adaptive counterpart. Our proposal is to compute an optimal batch of points, then select a single point from within this batch to evaluate. We realize this idea for both Bayesian optimization and Bayesian quadrature and demonstrate that our proposed method significantly outperforms common myopic alternatives on a variety of tasks.

研究动机与目标

  • 解决序列决策问题中贪心策略的局限性,后者将决策限制在单个时间步,通常难以平衡探索与利用。
  • 为有限时域决策问题中的最优策略提供一种通用的非贪心近似框架,尤其适用于贝叶斯优化与贝叶斯积分。
  • 通过利用最优批次的结构,弥合自适应策略与非自适应策略之间的差距,以指导单点选择。
  • 通过实现更长时域规划,在不引发难以处理的计算负担的前提下,提升贝叶斯优化与积分中的样本效率与收敛速度。

提出的方法

  • 该方法首先通过识别在有限时域内最大化期望信息增益的最优点批次,来构建非贪心策略。
  • 然后基于一种平衡期望效用与不确定性的选择准则,从该批次中选择单个点。
  • 该方法在最优自适应策略与其非自适应对应物之间建立了理论联系,从而通过批次优化实现可计算的近似。
  • 在贝叶斯优化中,该方法选择在批次上最大化期望改进或熵减少的点,随后进行单次评估。
  • 在贝叶斯积分中,它计算一组最小化期望积分误差的积分点批次,然后选择其中一点进行评估。
  • 该框架通过批次计算与选择性评估来避免求解难以处理的贝尔曼方程。

实验结果

研究问题

  • RQ1是否可以在不求解完整贝尔曼方程的前提下,高效地近似贝叶斯优化与积分中的非贪心策略?
  • RQ2从最优批次中选择单点与贪心的一步-ahead选择相比,在样本效率与收敛性方面有何差异?
  • RQ3基于批次的规划对序列决策问题中探索与利用的平衡有何影响?
  • RQ4是否可以利用自适应策略与非自适应策略之间的联系,设计出可扩展的非贪心方法?
  • RQ5所提出的方法是否在多样化的优化与积分任务中均优于标准的贪心基线?

主要发现

  • 所提方法在贝叶斯优化与贝叶斯积分任务中显著优于常见的贪心替代方法。
  • 通过利用批次优化与选择性点评估,该方法在收敛速度与样本效率方面优于一步-ahead策略。
  • 该框架通过考虑更长时域的影响,在不产生高昂计算成本的前提下,有效平衡了探索与利用。
  • 实验结果表明,该方法在多个基准任务中均表现出一致的改进,验证了非贪心批次选择策略的有效性。
  • 该方法在标准贝叶斯优化与积分基准测试中达到了最先进性能,尤其在高维或噪声环境下表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。