[论文解读] Contextual Bandit with Missing Rewards
本文提出 MLINUCB,一种上下文多臂老虎机算法,通过在线聚类技术填补缺失奖励,使在奖励未被观测时也能从上下文学习。通过将上下文向量建模为位于聚类流形上,该方法在标准 LINUCB 基础上提升了准确性,尤其在高比例缺失奖励的情况下,真实数据集(如 Internet Advertisements 和 Warfarin)上的准确率提升最高达 10.9%。
We consider a novel variant of the contextual bandit problem (i.e., the multi-armed bandit with side-information, or context, available to a decision-maker) where the reward associated with each context-based decision may not always be observed("missing rewards"). This new problem is motivated by certain online settings including clinical trial and ad recommendation applications. In order to address the missing rewards setting, we propose to combine the standard contextual bandit approach with an unsupervised learning mechanism such as clustering. Unlike standard contextual bandit methods, by leveraging clustering to estimate missing reward, we are able to learn from each incoming event, even those with missing rewards. Promising empirical results are obtained on several real-life datasets.
研究动机与目标
- 解决临床试验和广告推荐系统中常见的上下文多臂老虎机设置下奖励缺失的挑战。
- 即使奖励反馈部分或完全缺失,也能实现从上下文数据中有效学习。
- 通过利用上下文向量中的结构模式,改进标准上下文多臂老虎机方法(如 LINUCB)。
- 验证基于聚类的奖励填补在上下文空间呈现聚类流形结构时是否能提升性能。
- 探索超参数(如聚类数量和探索率)对算法性能的影响。
提出的方法
- 将在线聚类与 LINUCB 上下文多臂老虎机算法结合,利用相似的过去上下文估算缺失奖励。
- 使用 k-means 聚类将上下文向量分组,并将每个上下文分配至一个聚类以实现奖励填补。
- 利用同一聚类中观察到的平均奖励填补缺失奖励,假设相似上下文会产生相似奖励。
- 在每个聚类内应用线性模型以预测期望奖励,同时保持 LINUCB 框架的遗憾界。
- 将聚类数量 $N$ 视为超参数,其可进行在线优化或自适应选择。
- 采用聚类奖励的加权平均进行填补,可扩展至多个最近邻聚类($m > 1$)。
实验结果
研究问题
- RQ1当奖励缺失时,基于聚类的奖励填补是否能提升上下文多臂老虎机的性能?
- RQ2在何种条件下,上下文向量的聚类流形假设能带来性能提升?
- RQ3与标准 LINUCB 相比,聚类数量 $N$ 如何影响所提方法的准确率和遗憾?
- RQ4该方法在处理高比例缺失奖励时是否能保持较低遗憾?
- RQ5该算法能否在在线学习过程中自适应选择最优聚类数量 $N$?
主要发现
- 在 Internet Advertisements 数据集上,当 25% 的奖励缺失时,MLINUCB 的准确率从 LINUCB 的 86.6% 提升至 90.2%。
- 当奖励缺失比例达 50% 时,同一数据集上的准确率从 82.4% 提升至 90.3%,显示出对高缺失率的鲁棒性。
- 当奖励缺失比例达 75% 时,准确率从 78.6% 提升至 89.6%,表明在极端缺失情况下仍具持续优势。
- 在 Warfarin 数据集上,2D PCA 捕获了 98.2% 的方差,MLINUCB 在所有测试的聚类数量下均优于 LINUCB。
- 在 CNAE-9 数据集上,MLINUCB 在各种探索率 $\alpha$ 下均优于 LINUCB,即使在方差较低的 2D 投影(13.9%)下亦然。
- Covertype 数据集的 2D PCA 仅捕获 29.7% 的方差,MLINUCB 未带来性能提升,表明违反了流形假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。