Skip to main content
QUICK REVIEW

[论文解读] Online Learning in Contextual Bandits using Gated Linear Networks

Eren Sezener, Marcus Hütter|arXiv (Cornell University)|Feb 21, 2020
Advanced Bandit Algorithms Research参考文献 26被引用 8
一句话总结

本文提出门控线性上下文Bandit(GLCB),一种在线算法,利用门控线性网络(GLNs)实现上下文Bandit中高效、不确定性感知的探索。通过利用GLNs的半空间门控结构,GLCB基于SimHash签名计算伪计数,实现可扩展、数据相关的探索,且算法开销为零,从而在离散和连续Bandit基准测试中均达到最先进性能,同时保持完全在线特性。

ABSTRACT

We introduce a new and completely online contextual bandit algorithm called Gated Linear Contextual Bandits (GLCB). This algorithm is based on Gated Linear Networks (GLNs), a recently introduced deep learning architecture with properties well-suited to the online setting. Leveraging data-dependent gating properties of the GLN we are able to estimate prediction uncertainty with effectively zero algorithmic overhead. We empirically evaluate GLCB compared to 9 state-of-the-art algorithms that leverage deep neural networks, on a standard benchmark suite of discrete and continuous contextual bandit problems. GLCB obtains median first-place despite being the only online method, and we further support these results with a theoretical study of its convergence properties.

研究动机与目标

  • 开发一种完全在线的上下文Bandit算法,支持高效、基于不确定性的探索。
  • 克服现有方法在上下文Bandit中对离线深度特征提取和非在线贝叶斯神经网络方法的局限性。
  • 利用GLN门控结构派生的数据相关伪计数,在高维上下文中实现可扩展的探索。
  • 通过利用GLN门控的归纳偏置,将探索与模型不确定性紧密耦合。
  • 在保持在线学习效率的同时,在标准基准测试中实现最先进性能。

提出的方法

  • GLCB使用具有半空间门控的门控线性网络(GLNs)建模动作价值函数,支持通用函数逼近和结构化归纳偏置。
  • GLNs中的门控机制被重新用于计算基于SimHash的签名,用于定义探索用的伪计数。
  • 伪计数按每个门控单元维护,并根据上下文签名增量更新,实现在高维状态间的泛化。
  • 探索由基于伪计数的UCB风格奖励驱动,直接将不确定性与动作选择关联。
  • 通过按动作计数衰减的学习率在线更新模型参数,确保稳定性和收敛性。
  • 通过维护每个动作的单一、持续更新的GLN,避免昂贵的重新训练,无需后验近似或蒙特卡洛采样。

实验结果

研究问题

  • RQ1基于深度学习的上下文Bandit算法能否在保持在线学习能力的同时实现最先进性能?
  • RQ2基于GLN门控结构派生的伪计数能否在高维上下文中有效泛化?
  • RQ3GLN门控与伪计数的耦合是否能提供优于标准贝叶斯深度学习方法的不确定性估计?
  • RQ4该方法在多样化基准测试中能否在平均性能上超越非在线神经贝叶斯Bandit算法?
  • RQ5使用基于GLN的伪计数时,不确定性估计的计算开销是否可忽略?

主要发现

  • GLCB在所有评估基准中均取得平均排名首位,优于九种最先进基于深度学习的上下文Bandit算法。
  • 尽管是对比中唯一完全在线的方法,GLCB的性能仍与非在线贝叶斯神经网络方法相当或更优。
  • 基于GLN门控的伪计数机制提供了高效、可扩展的探索,且计算开销极低。
  • 该算法展现出强收敛性,其UCB风格探索策略得到理论分析支持。
  • 通过网格搜索进行超参数调优,在合成数据和真实世界数据集(包括伯努利分布和连续Bandit问题)上均表现出稳健性能。
  • 通过利用GLN门控的局部敏感哈希特性,该方法在高维上下文中实现了有效泛化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。