Skip to main content
QUICK REVIEW

[论文解读] Meta-Learning for Contextual Bandit Exploration

Amr Sharaf, Hal Daumé|arXiv (Cornell University)|Jan 23, 2019
Advanced Bandit Algorithms Research参考文献 32被引用 10
一句话总结

Mêlée 是一种元学习算法,通过使用合成数据和模仿学习训练上下文Bandit的探索策略,使其能够在多样化的现实任务中实现泛化。它在300个真实世界数据集上优于七个基线模型,尤其在奖励差异较大时表现更优,通过从离线模拟中学习有效的探索启发式规则,无需在训练过程中进行在线交互。

ABSTRACT

We describe MELEE, a meta-learning algorithm for learning a good exploration policy in the interactive contextual bandit setting. Here, an algorithm must take actions based on contexts, and learn based only on a reward signal from the action taken, thereby generating an exploration/exploitation trade-off. MELEE addresses this trade-off by learning a good exploration strategy for offline tasks based on synthetic data, on which it can simulate the contextual bandit setting. Based on these simulations, MELEE uses an imitation learning strategy to learn a good exploration policy that can then be applied to true contextual bandit tasks at test time. We compare MELEE to seven strong baseline contextual bandit algorithms on a set of three hundred real-world datasets, on which it outperforms alternatives in most settings, especially when differences in rewards are large. Finally, we demonstrate the importance of having a rich feature representation for learning how to explore.

研究动机与目标

  • 开发一种元学习方法,自动学习上下文Bandit的有效探索策略,避免使用手工设计的启发式规则。
  • 通过在模拟探索-利用权衡的合成数据上进行训练,实现在多样化真实世界上下文Bandit任务中的泛化能力。
  • 在奖励差异较大的设置中提升性能,因为传统探索策略在此类场景中常表现不佳。
  • 探究丰富特征表示是否能提升所学探索策略的质量。
  • 证明模仿学习在从合成数据的反事实模拟中学习探索启发式规则方面的有效性。

提出的方法

  • Mêlée 在完全标注的合成数据集上进行训练,以模拟上下文Bandit的交互过程,从而在每轮中对所有动作的奖励进行反事实估计。
  • 它使用模仿学习(AggreVaTe)通过模仿在模拟环境中最小化遗憾的策略行为,来学习探索策略。
  • 该算法基于从合成数据中计算出的遗憾估计值,优化一个代价函数,以鼓励那些本应导致更低累积遗憾的动作。
  • 它利用分类器的校准概率以及额外特征(如不确定性、置信度)来丰富探索决策的状态表示。
  • 探索策略在离线状态下训练完成,随后直接部署于真实世界上下文Bandit任务中,无需进一步在线适应。
  • 与传统Bandit算法不同,该方法从数据中学习探索策略,而非依赖ε-greedy或LinUCB等固定规则。

实验结果

研究问题

  • RQ1元学习方法是否能在训练期间无需在线交互的情况下,有效学习到适用于上下文Bandit的可泛化探索策略?
  • RQ2Mêlée 在多样化的真实世界数据集上与已建立的上下文Bandit算法相比,性能如何?
  • RQ3丰富特征表示在多大程度上能提升所学探索策略的质量?
  • RQ4在真实世界Bandit设置中,基于合成数据的模仿学习是否比手工设计的探索策略带来更好的泛化性能?
  • RQ5Mêlée 在合成训练数据与真实世界测试数据之间存在分布偏移时,其鲁棒性如何?

主要发现

  • Mêlée 在300个真实世界数据集中优于七个强基线算法,其中147个数据集表现出统计显著性提升,124个数据集无显著差异。
  • 在奖励差异较大的设置中,该算法表现更优,而基线方法常因无法有效探索而表现不佳。
  • 包含校准概率和不确定性估计的完整特征集,相比仅使用校准概率的简化特征版本,具有24场胜利的优势。
  • 学习曲线显示,Mêlée 随数据量增加持续提升性能,而τ-first等基线方法则早期趋于平稳,表明其具有更好的样本效率。
  • 尽管在分布偏移下缺乏理论遗憾保证,Mêlée 在实践中表现出良好的泛化能力,提示未来可对所学探索策略进行理论分析。
  • 离线训练的计算成本仍是其局限,尤其在大规模或高维任务中,但该方法在多样化特征空间中表现出良好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。