QUICK REVIEW
[论文解读] Warm-starting Contextual Bandits: Robustly Combining Supervised and Bandit Feedback
Chicheng Zhang, Alekh Agarwal|arXiv (Cornell University)|Jan 2, 2019
Advanced Bandit Algorithms Research参考文献 29被引用 12
一句话总结
本文提出 ARROW-CB,一种用于上下文Bandit的无遗憾算法,能够稳健地结合监督反馈与上下文Bandit反馈,即使两种数据源的成本分布不一致也能有效处理。该方法通过基于假设类别的成本相似性度量,自适应地平衡两类数据,实现的遗憾接近于预先知晓最优加权策略的最优解,且在数百个数据集上的实证验证表明,其性能持续优于基线方法。
ABSTRACT
We investigate the feasibility of learning from a mix of both fully-labeled supervised data and contextual bandit data. We specifically consider settings in which the underlying learning signal may be different between these two data sources. Theoretically, we state and prove no-regret algorithms for learning that is robust to misaligned cost distributions between the two sources. Empirically, we evaluate some of these algorithms on a large selection of datasets, showing that our approach is both feasible and helpful in practice.
研究动机与目标
- 开发一种稳健的学习算法,以在上下文Bandit设置中有效结合监督数据与上下文Bandit反馈,尤其当两类数据源的底层成本分布不一致时。
- 确保当专家(监督)反馈与用户(Bandit)反馈信号不完全对齐时仍能实现无遗憾学习,这在现实应用中十分常见。
- 设计一种方法,使其性能接近于已知两类反馈源之间成本相似性的最优解(oracle),从而最小化因搜索最优加权策略而产生的遗憾损失。
- 在具有不同程度偏差与噪声的监督预热数据的广泛数据集上,对方法进行实证验证。
提出的方法
- 提出 ARROW-CB,一种无遗憾算法,通过加权损失函数结合监督样本与上下文Bandit反馈来学习策略。
- 引入一种基于假设类别的成本相似性度量,用于量化监督反馈与Bandit反馈分布之间的差异,该度量用于理论分析,但不直接参与算法实现。
- 采用自适应加权机制,搜索监督反馈与Bandit反馈之间的最优平衡,以最小化相对于已知成本相似性的最优解(oracle)的遗憾。
- 在上下文Bandit阶段采用 ϵ-greedy 探索策略,其中 ϵ 根据实验设置设定为 0.0125 或 0.1,以确保充分探索。
- 使用参数 |Λ| 控制在两类数据源之间搜索最优加权的粒度,实验中 |Λ| = 8 表现出更优性能。
- 通过从完全标注的数据集中模拟上下文Bandit反馈,以在受控条件下评估性能,同时调节监督数据中的偏差与噪声水平。
实验结果
研究问题
- RQ1当结合成本分布不一致的监督反馈与Bandit反馈时,上下文Bandit算法能否实现无遗憾学习?
- RQ2与忽略某一数据源或简单平均两种数据源的基线方法相比,所提方法的性能如何?
- RQ3监督预热数据中不同程度的偏差对联合学习方法性能有何影响?
- RQ4所提方法的性能与已知最优加权策略的最优解(oracle)相比有多接近?
主要发现
- 在数百个数据集的聚合性能上,|Λ| = 8 的 ARROW-CB 显著优于所有基线方法,包括其他同样使用两类数据源的方法。
- 无论噪声水平或预热数据比例如何,ARROW-CB 的归一化误差累积分布函数(CDF)始终优于所有基线,包括 Sup-Only、Bandit-Only 和 Majority。
- 即使监督数据存在偏差(例如,p = 0.25 或 p = 0.5),ARROW-CB 仍保持优异性能,表明其对分布不一致具有强鲁棒性。
- |Λ| = 8 的 ARROW-CB 性能始终优于 |Λ| = 2 的版本,表明对加权参数进行更精细的搜索可提升鲁棒性。
- SIM-BANDIT 作为同样利用两类数据的基线,其性能显著劣于 ARROW-CB,凸显了所提自适应加权机制的优势。
- 在所有实验条件下,包括无噪声与高噪声设置,ARROW-CB 均保持卓越性能,CDF 曲线显示在更高比例条件下误差低于任意给定阈值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。