Skip to main content
QUICK REVIEW

[论文解读] Budget-Constrained Bandits over General Cost and Reward Distributions

Semih Çaycı, Atilla Eryılmaz|arXiv (Cornell University)|Feb 29, 2020
Advanced Bandit Algorithms Research参考文献 30被引用 5
一句话总结

本文提出了一种新颖的上下文 bandit 算法,用于处理具有普遍性、相关性以及潜在重尾分布的成本-收益对的预算约束决策问题。通过利用线性最小均方误差(LMMSE)估计来挖掘成本-收益之间的相关性,该方法在 $(2+\gamma)$-阶矩条件下实现了 $O(\log B)$ 的遗憾,且问题相关的紧致边界最优,仅相差一个绝对常数因子,适用于联合高斯分布的情形。

ABSTRACT

We consider a budget-constrained bandit problem where each arm pull incurs a random cost, and yields a random reward in return. The objective is to maximize the total expected reward under a budget constraint on the total cost. The model is general in the sense that it allows correlated and potentially heavy-tailed cost-reward pairs that can take on negative values as required by many applications. We show that if moments of order $(2+γ)$ for some $γ> 0$ exist for all cost-reward pairs, $O(\log B)$ regret is achievable for a budget $B>0$. In order to achieve tight regret bounds, we propose algorithms that exploit the correlation between the cost and reward of each arm by extracting the common information via linear minimum mean-square error estimation. We prove a regret lower bound for this problem, and show that the proposed algorithms achieve tight problem-dependent regret bounds, which are optimal up to a universal constant factor in the case of jointly Gaussian cost and reward pairs.

研究动机与目标

  • 解决多臂 bandit 中的预算约束挑战,其中每次动作选择会产生随机的、可能相关的成本,并带来随机的收益。
  • 设计学习算法,在成本-收益分布无界、相关且具有重尾特性的条件下,实现紧致的遗憾边界。
  • 通过 LMMSE 估计利用成本与收益之间的相关性,以提高学习效率和遗憾表现。
  • 建立遗憾的下界,并证明所提出的算法在问题相关设定下达到最优或近似最优性能。
  • 将经典 bandit 理论扩展至一般成本-收益分布,超越确定性或有界支撑的假设。

提出的方法

  • 使用线性最小均方误差(LMMSE)估计来提取并利用每条臂的成本-收益之间的相关性。
  • 设计一种学习算法,将 LMMSE 估计器作为真实成本-收益方差的代理,以在相关性存在时提升估计精度。
  • 应用协方差与方差经验估计器的集中不等式,以高概率界定向估计误差。
  • 通过将估计误差与采样低效性分离的分解方法推导遗憾边界,利用成本-收益对的矩条件。
  • 引入样本量的稳定性条件,以确保 LMMSE 系数与残差方差的可靠估计。
  • 采用一种改进的 UCB 风格算法,结合估计的成本-收益相关性与方差,以在预算约束下平衡探索与利用。

实验结果

研究问题

  • RQ1在具有普遍性、相关性以及潜在重尾成本-收益对的预算约束 bandit 场景中,能否实现 $O(\log B)$ 的遗憾?
  • RQ2如何利用成本与收益之间的相关性以降低此类场景下的遗憾?
  • RQ3该问题的根本极限(下界)是什么?算法能多接近这一极限?
  • RQ4在成本与收益联合高斯分布的情况下,所提算法能否实现最优遗憾边界,仅相差一个绝对常数因子?
  • RQ5为确保 LMMSE 系数与残差方差的可靠估计,需要满足何种样本量条件?

主要发现

  • 在成本-收益对具有有限 $2+\gamma$ 阶矩($\gamma > 0$)的假设下,所提算法实现了 $O(\log B)$ 的遗憾。
  • 通过 LMMSE 估计利用成本-收益相关性,该算法实现了紧致的问题相关遗憾边界,对于联合高斯成本与收益对,其最优性仅相差一个绝对常数因子。
  • 为预算约束 bandit 问题建立了遗憾下界,且在高斯情况下与上界仅相差一个常数因子。
  • 集中分析表明,只要样本量满足涉及成本方差的稳定性条件,LMMSE 估计器及其方差估计将以高概率收敛。
  • 只要存在 $(2+\gamma)$-阶矩,该方法对重尾分布具有鲁棒性,从而扩展了其适用范围,超越了有界或轻尾假设。
  • 与未利用成本-收益相关性的先前方法相比,该算法在成本与收益强相关的情境下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。