Skip to main content
QUICK REVIEW

[论文解读] Thompson Sampling for Contextual Bandit Problems with Auxiliary Safety Constraints

Samuel Daulton, Shaun Singh|arXiv (Cornell University)|Nov 1, 2019
Advanced Bandit Algorithms Research被引用 8
一句话总结

本文提出了一种基于辅助安全约束的汤普森采样算法(TS-ASC),这是一种新型的上下文Bandit算法,旨在在优化主要奖励的同时,对相对于基线策略的辅助指标施加随机安全约束。该方法实现了多目标场景下的安全探索——在真实世界的视频转码任务中得到验证——其中策略需在不降低上传可靠性的情况下提升质量,通过贝叶斯优化安全与奖励参数,实现两个指标的同步提升。

ABSTRACT

Recent advances in contextual bandit optimization and reinforcement learning have garnered interest in applying these methods to real-world sequential decision making problems. Real-world applications frequently have constraints with respect to a currently deployed policy. Many of the existing constraint-aware algorithms consider problems with a single objective (the reward) and a constraint on the reward with respect to a baseline policy. However, many important applications involve multiple competing objectives and auxiliary constraints. In this paper, we propose a novel Thompson sampling algorithm for multi-outcome contextual bandit problems with auxiliary constraints. We empirically evaluate our algorithm on a synthetic problem. Lastly, we apply our method to a real world video transcoding problem and provide a practical way for navigating the trade-off between safety and performance using Bayesian optimization.

研究动机与目标

  • 解决现实世界中存在多个竞争目标以及相对于基线策略的安全约束的序列决策问题。
  • 开发一种实用且稳健的方法,以平衡探索与利用的权衡,同时确保辅助指标(如可靠性)不会低于基线水平。
  • 将现有上下文Bandit框架推广至具有随机、未知安全约束的场景,超越单一目标优化。
  • 提供一种可扩展的、基于贝叶斯优化的方法,用于在生产系统中调节安全与奖励之间的权衡。
  • 在真实世界的视频转码应用中展示该方法的有效性,其中质量与可靠性存在冲突。

提出的方法

  • 提出一种基于汤普森采样的算法TS-ASC,通过将成功概率(如可靠上传)建模为上下文和动作的函数,来整合辅助安全约束。
  • 使用共享的两层全连接神经网络从上下文-动作对中提取特征,随后采用具有线性核的高斯过程和伯努利似然来建模成功概率。
  • 引入一种奖励塑造机制,将主要目标(如1080p质量保持)与由α参数化的安全阈值相结合,该参数控制辅助指标性能可接受的下降幅度。
  • 采用带有噪声期望改进获取函数的贝叶斯优化,联合调优奖励函数参数(Ω)和安全阈值(α),在噪声且受限的结果下进行优化。
  • 将辅助安全约束建模为随机的、时变的基线,确保策略在各子群体中不会使可靠性低于当前现状。
  • 通过A/B测试和响应面建模验证方法,可视化不同α值和奖励参数设置下质量与可靠性之间的权衡。

实验结果

研究问题

  • RQ1在具有随机性、上下文依赖性的环境中,上下文Bandit算法能否有效优化主要奖励指标,同时确保辅助指标不会低于基线策略的表现?
  • RQ2当基线表现时变且事先未知时,如何对安全约束进行建模与强制执行?
  • RQ3安全阈值参数α对现实系统中性能提升与可靠性保持之间权衡的影响是什么?
  • RQ4汤普森采样能否扩展以处理具有噪声二元结果的多目标Bandit问题中的辅助安全约束?
  • RQ5在生产规模的应用中,所提出的TS-ASC方法与原始汤普森采样相比,在性能与安全性方面表现如何?

主要发现

  • TS-ASC在提升1080p视频保留为1080p质量的比例的同时,成功维持或提升了上传可靠性,实现了两个指标的同步改进。
  • 当α接近0时,策略确保相对于基线的可靠性不会下降,体现了强大的安全约束能力。
  • 随着α增大,策略变得更加宽松,允许在可靠性出现小幅、可接受下降的情况下实现更高画质的上传,这一趋势在响应面分析中得到体现。
  • 原始汤普森采样在所有测试参数设置下均持续降低可靠性,凸显了辅助安全约束的必要性。
  • 贝叶斯优化有效识别出能带来有利权衡的参数配置(α和Ω),且TS-ASC策略在质量和可靠性方面均优于原始TS。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。