Skip to main content
QUICK REVIEW

[论文解读] Randomized Allocation with Nonparametric Estimation for Contextual Multi-Armed Bandits with Delayed Rewards

Sakshi Arya, Yuhong Yang|arXiv (Cornell University)|Feb 3, 2019
Advanced Bandit Algorithms Research参考文献 27被引用 5
一句话总结

该论文提出了一种非参数化、随机化的上下文多臂赌博机分配策略,适用于延迟奖励场景,采用基于直方图的估计方法自适应学习奖励函数。该方法确保了强一致性,证明即使在反馈存在随机延迟的情况下,累积奖励仍几乎必然收敛至最优水平。

ABSTRACT

We study a multi-armed bandit problem with covariates in a setting where there is a possible delay in observing the rewards. Under some mild assumptions on the probability distributions for the delays and using an appropriate randomization to select the arms, the proposed strategy is shown to be strongly consistent.

研究动机与目标

  • 填补非参数设定下上下文多臂赌博机延迟奖励问题的理论框架空白。
  • 将奖励延迟建模为独立但非同分布的随机变量,以反映临床和在线应用中的实际延迟情况。
  • 设计一种随机化策略,在考虑延迟反馈的前提下平衡探索与利用。
  • 在奖励函数平滑性假设最小的条件下,建立算法的理论一致性。
  • 即使反馈延迟且不完整,也能确保估计奖励收敛至真实期望奖励。

提出的方法

  • 使用非参数化直方图估计器,基于协变量局部邻域内观测到的奖励,近似每个臂 $ i $ 的条件均值奖励 $ f_i(x) $。
  • 采用退火 $ \epsilon $-贪婪策略并引入随机化,以平衡探索与利用,确保所有臂均得到充分采样。
  • 将 $ \bar{N}(x) $ 定义为在 $ x $ 的局部邻域内选择臂 $ i $ 的次数,并利用其计算经验均值奖励估计器。
  • 利用连续模 $ w(h;f) $ 控制估计误差,并通过浓度不等式控制随机误差。
  • 利用改进的伯恩斯坦不等式控制相关伯努利试验(臂选择)的和以及类似子威布尔误差和的尾部概率。
  • 基于条件独立性假设:臂选择 $ W_j $ 与未来误差 $ \epsilon_j $ 条件独立,从而可对加权误差和施加浓度界。

实验结果

研究问题

  • RQ1非参数化上下文赌博机算法在延迟奖励反馈下能否保持强一致性?
  • RQ2当奖励无法立即观测时,随机化分配策略的选择如何影响收敛性?
  • RQ3非独立同分布且可能重尾的延迟对奖励函数估计有何影响?
  • RQ4基于直方图的非参数估计能否在延迟且不完整的反馈下实现奖励预测的一致性?
  • RQ5在何种条件下,所提算法的累积奖励几乎必然收敛至最优累积奖励?

主要发现

  • 所提算法实现了强一致性:即使存在延迟反馈,估计奖励函数 $ \hat{f}_n(x) $ 几乎必然收敛至真实值 $ f(x) $,当 $ n \to \infty $ 时。
  • 估计误差受连续模 $ w(h;f) $ 限制,并通过浓度不等式控制随机项。
  • 大估计误差的概率随每个局部邻域内观测数目的增加呈指数衰减,如不等式 $ \exp(-c \cdot \min_b N_b) $ 所示。
  • 分析表明,臂在邻域内被选择的比例收敛至目标分配概率 $ \pi_n $,从而确保充分探索。
  • 该方法的累积遗憾增加量与现有延迟赌博机框架相当,尽管本文重点在于一致性而非遗憾界。
  • 使用改进的伯恩斯坦不等式可控制加权误差和 $ \sum W_j \epsilon_j $,即使 $ W_j $ 依赖于历史观测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。