Skip to main content
QUICK REVIEW

[论文解读] Bayesian Optimization for Policy Search via Online-Offline Experimentation

Benjamin Letham, Eytan Bakshy|arXiv (Cornell University)|Apr 1, 2019
Advanced Bandit Algorithms Research被引用 16
一句话总结

本文提出了一种多任务贝叶斯优化框架,结合离线仿真器评估与在线A/B测试,以高效调优现实世界机器学习系统中的复杂机器学习策略。通过使用低秩多任务高斯过程联合建模仿真器与在线实验结果,该方法显著减少了对昂贵在线实验的需求,在存在仿真器偏差的情况下仍实现了优化效率与准确性的显著提升。

ABSTRACT

Online field experiments are the gold-standard way of evaluating changes to real-world interactive machine learning systems. Yet our ability to explore complex, multi-dimensional policy spaces - such as those found in recommendation and ranking problems - is often constrained by the limited number of experiments that can be run simultaneously. To alleviate these constraints, we augment online experiments with an offline simulator and apply multi-task Bayesian optimization to tune live machine learning systems. We describe practical issues that arise in these types of applications, including biases that arise from using a simulator and assumptions for the multi-task kernel. We measure empirical learning curves which show substantial gains from including data from biased offline experiments, and show how these learning curves are consistent with theoretical results for multi-task Gaussian process generalization. We find that improved kernel inference is a significant driver of multi-task generalization. Finally, we show several examples of Bayesian optimization efficiently tuning a live machine learning system by combining offline and online experiments.

研究动机与目标

  • 为解决现实世界机器学习系统中在线A/B测试成本高、吞吐量低的问题,特别是针对复杂、多维的策略空间。
  • 通过将离线仿真器评估与在线实验整合,将其视为多保真度观测,提升优化效率。
  • 对由仿真器非平稳性及偏离策略行为引发的偏差进行建模与校正,尤其针对不同仿真器批次之间的偏差。
  • 评估多任务高斯过程模型在结合离线与在线数据进行策略搜索时的实证性能。
  • 证明改进的核函数推断,特别是通过低秩任务协方差结构,是多任务优化中泛化能力的关键驱动力。

提出的方法

  • 该方法使用具有内在核心化(ICM)核的多任务高斯过程(MTGP),联合建模来自离线仿真器和在线A/B测试的响应。
  • 将每个离线仿真器批次视为独立任务,使模型能够学习并校正随时间顺序的仿真器运行中的非平稳性偏差。
  • 采用任务协方差矩阵的低秩近似,以处理多个仿真器批次带来的高维性,提升可扩展性与泛化能力。
  • 在线优化器使用一种平衡探索与利用的采集函数,整合来自离线与在线评估的信息。
  • 框架通过在多个仿真器批次中重复策略评估,实现对时间依赖性偏差的估计,提升模型校准能力。
  • 使用交叉验证验证模型性能,确保对模型误设与非平稳性的鲁棒性。

实验结果

研究问题

  • RQ1离线仿真器评估是否能显著减少现实世界机器学习系统中策略搜索所需的在线A/B测试次数?
  • RQ2如何有效建模并校正由时间变化的用户行为与项目特征引起的仿真器非平稳性带来的偏差?
  • RQ3多任务高斯过程建模,特别是采用低秩任务协方差结构,能在多大程度上提升泛化能力与优化性能?
  • RQ4包含有偏离线数据对贝叶斯优化中的学习曲线与收敛速度有何影响?
  • RQ5在在线-离线实验背景下,改进的核函数推断对多任务泛化能力有何影响?

主要发现

  • 实证学习曲线显示,引入有偏离线仿真器数据可显著提升优化性能,实现更快收敛并减少在线实验需求。
  • 引入离线数据可加速在线优化器对其最优策略信念的不确定性(熵)降低。
  • 仿真器批次间的非平稳性引入了时间依赖性偏差,如响应曲面的线性漂移,这些偏差可通过低秩ICM核有效建模。
  • 模型从有偏离线数据中学习的能力主要源于改进的核函数推断,特别是通过低秩任务协方差结构。
  • 在仿真器批次中重复策略的使用,使时间变化偏差的估计更加有效,从而提升模型校准与泛化能力。
  • 交叉验证结果表明,即使在模型误设与非平稳性存在的情况下,多任务模型仍表现良好,验证了其在现实场景中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。