Skip to main content
QUICK REVIEW

[论文解读] Online learning with Corrupted context: Corrupted Contextual Bandits

Djallel Bouneffouf|arXiv (Cornell University)|Jun 26, 2020
Advanced Bandit Algorithms Research参考文献 36被引用 10
一句话总结

该论文提出了一种新颖的上下文Bandit算法TSCC,通过将Thompson Sampling与经典的多臂Bandit方法相结合,以应对在线学习中的上下文污染问题。通过同时从污染和未污染的上下文中学习,TSCC在高污染率下相比标准上下文Bandit和MAB基线方法表现出更低的分类误差,展现出更强的鲁棒性和在真实数据集上的性能提升。

ABSTRACT

We consider a novel variant of the contextual bandit problem (i.e., the multi-armed bandit with side-information, or context, available to a decision-maker) where the context used at each decision may be corrupted ("useless context"). This new problem is motivated by certain on-line settings including clinical trial and ad recommendation applications. In order to address the corrupted-context setting,we propose to combine the standard contextual bandit approach with a classical multi-armed bandit mechanism. Unlike standard contextual bandit methods, we are able to learn from all iteration, even those with corrupted context, by improving the computing of the expectation for each arm. Promising empirical results are obtained on several real-life datasets.

研究动机与目标

  • 为解决在线决策系统中不可靠或污染的上下文带来的挑战。
  • 开发一种即使在上下文特征频繁不准确或具有误导性时仍保持有效性的学习框架。
  • 结合上下文Bandit与经典多臂Bandit的优势,提升真实应用中的鲁棒性。
  • 理论上分析在上下文污染条件下所提算法的遗憾边界。
  • 在不同污染水平的真实数据集上实证验证该方法。

提出的方法

  • TSCC算法将上下文Bandit的Thompson Sampling与非上下文MAB机制相结合,独立于上下文质量估算臂的奖励。
  • 维护两套独立的奖励估计:一套基于上下文(当其有效时),另一套基于全局臂表现(对上下文污染具有鲁棒性)。
  • 通过贝叶斯后验抽样动态平衡探索与利用,整合上下文与非上下文奖励估计。
  • 关键组件是使用污染概率模型来加权观察到的上下文的可靠性,从而实现自适应学习。
  • 采用混合决策策略,基于上下文预测与全局Bandit估计的组合选择动作。
  • 理论分析推导出遗憾的上界,表明当上下文以已知概率被污染时,该算法仍能保持次线性遗憾。

实验结果

研究问题

  • RQ1当用于决策的上下文频繁被污染时,在线学习算法如何维持性能?
  • RQ2将上下文Bandit与经典多臂Bandit结合,是否能提升在不可靠上下文下的鲁棒性?
  • RQ3一种从污染和未污染上下文同时学习的混合算法,其理论遗憾边界是什么?
  • RQ4在不同污染水平下,所提方法与标准上下文Bandit和MAB基线相比性能如何?
  • RQ5在哪些真实应用场景中,该混合方法显著优于标准方法?

主要发现

  • 在Covertype数据集上,TSCC在95%上下文污染率下实现了63.44 ± 3.75的误分类误差,显著优于CMAB(65.54 ± 4.57)和MAB(70.54 ± 0.30)。
  • 在CNAE-9数据集上,75%污染率下,TSCC相比CMAB将误差降低了11.5%,展现出强大的鲁棒性。
  • 在Internet Advertisements数据集上,TSCC在95%污染率下实现15.21 ± 1.10的误差,优于CMAB(16.21 ± 2.54)和MAB(19.22 ± 0.20)。
  • 在50%污染率下,TSCC在所有数据集中均达到最低误差,表明当上下文可靠性中等时性能最优。
  • MAB基线在95%污染率下表现最佳,表明当上下文过于不可靠时,上下文方法性能下降,而TSCC仍保持优势。
  • 实证结果表明,TSCC在所有污染水平和数据集上均持续优于CMAB和MAB,证实了混合学习方法的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。