[论文解读] Contextual Semibandits via Supervised Learning Oracles
本文提出了基于oracle的上下文语义Bandit算法,将问题转化为监督学习以实现高效、高性能的策略学习。针对已知奖励映射,提出VCEE算法,实现近乎最优的遗憾;针对未知映射,提出EELS算法,在真实世界的学习排序数据集上实现了卓越的计算效率和遗憾边界。
We study an online decision making problem where on each round a learner chooses a list of items based on some side information, receives a scalar feedback value for each individual item, and a reward that is linearly related to this feedback. These problems, known as contextual semibandits, arise in crowdsourcing, recommendation, and many other domains. This paper reduces contextual semibandits to supervised learning, allowing us to leverage powerful supervised learning methods in this partial-feedback setting. Our first reduction applies when the mapping from feedback to reward is known and leads to a computationally efficient algorithm with near-optimal regret. We show that this algorithm outperforms state-of-the-art approaches on real-world learning-to-rank datasets, demonstrating the advantage of oracle-based algorithms. Our second reduction applies to the previously unstudied setting when the linear mapping from feedback to reward is unknown. Our regret guarantees are superior to prior techniques that ignore the feedback.
研究动机与目标
- 解决在结构化、组合动作空间中,仅对单个项目提供部分反馈,且反馈用于生成复合奖励的在线决策问题。
- 使强大的监督学习算法(如SVM、提升方法)作为oracle,用于学习表达性强的策略,而无需对动作集进行直接枚举。
- 设计计算高效的算法,在已知与未知线性奖励映射设置下均实现近乎最优的遗憾。
- 通过实验证明,基于oracle的探索在大规模学习排序任务中显著优于以往的上下文语义Bandit方法。
提出的方法
- 通过将策略学习建模为基于个体项目反馈的监督预测问题,将上下文语义Bandit问题转化为监督学习问题。
- 针对已知奖励映射,提出VCEE(值校正探索)算法,利用oracle选择在反馈到奖励的线性关系下最小化遗憾的策略。
- 设计EELS(线性搜索的探索-利用)算法,首先通过均匀探索估计未知的线性映射,然后切换到经验最优策略。
- 在EELS中采用两阶段策略:初始阶段进行均匀探索以估计线性权重向量,随后使用学习到的权重进行自适应利用。
- 通过集中不等式(Freedman、Azuma、Hanson-Wright与矩阵Bernstein)推导遗憾边界,分析探索与利用之间的权衡。
- 通过集成oracle访问最小化计算开销,使方法可扩展至大规模策略类与真实世界数据集。
实验结果
研究问题
- RQ1能否将上下文语义Bandit问题有效转化为监督学习问题,以利用强大的学习oracle?
- RQ2当从项目反馈到复合奖励的线性映射已知时,可实现怎样的遗憾边界?与现有方法相比如何?
- RQ3如何以计算高效的方式学习未知的从反馈到奖励的线性映射,同时具备可证明的遗憾保证?
- RQ4在真实世界推荐与排序应用中,基于oracle的探索在丰富策略类上是否能带来显著的性能提升?
- RQ5当奖励映射未知时,探索与利用之间的最优权衡是什么?如何在遗憾最小化框架中形式化这一权衡?
主要发现
- VCEE在不同问题结构下实现$\tilde{O}(\sqrt{KLT\log N})$至$\tilde{O}(L\sqrt{KT\log N})$的遗憾边界,且仅需$\tilde{O}(T^{3/2})$次oracle调用,在理论与实践上均优于先前方法。
- 当线性映射未知时,EELS实现$\tilde{O}((LT)^{2/3}(K\log N)^{1/3})$的遗憾边界,优于现有计算高效的同类方法。
- 在真实世界的学习排序数据集上,VCEE显著优于最先进的上下文语义Bandit基线方法,验证了基于oracle算法的实际优势。
- 理论分析表明,EELS的遗憾边界在$L$上呈次优增长,但在未知权重设置下仍优于先前方法。
- 本文首次对基于oracle的上下文Bandit与语义Bandit算法进行了全面的实证评估,验证了其在大规模场景下的有效性。
- 在给定假设下,推导出的遗憾边界是紧致的,分析依赖于先进的集中不等式,并对探索-利用权衡进行了细致处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。