Skip to main content
QUICK REVIEW

[论文解读] Neural Contextual Bandits with Deep Representation and Shallow Exploration

Pan Xu, Zheng Wen|arXiv (Cornell University)|Dec 3, 2020
Advanced Bandit Algorithms Research参考文献 47被引用 18
一句话总结

该论文提出 Neural-LinUCB,一种上下文多臂老虎机算法,利用深度 ReLU 神经网络进行表征学习,而仅在最后的线性层中使用上置信度(UCB)探索策略。该方法实现了 $×{O}(ackslashsqrt{T})$ 的遗憾,与线性 bandit 算法持平,同时通过避免在整个网络参数空间中进行探索,显著提升了计算效率。

ABSTRACT

We study a general class of contextual bandits, where each context-action pair is associated with a raw feature vector, but the reward generating function is unknown. We propose a novel learning algorithm that transforms the raw feature vector using the last hidden layer of a deep ReLU neural network (deep representation learning), and uses an upper confidence bound (UCB) approach to explore in the last linear layer (shallow exploration). We prove that under standard assumptions, our proposed algorithm achieves $ ilde{O}(\sqrt{T})$ finite-time regret, where $T$ is the learning time horizon. Compared with existing neural contextual bandit algorithms, our approach is computationally much more efficient since it only needs to explore in the last layer of the deep neural network.

研究动机与目标

  • 解决现有神经网络上下文多臂老虎机算法在全网络参数空间中探索所导致的计算效率低下问题。
  • 在原始、高维的上下文-动作特征设置下,提升样本效率与遗憾性能。
  • 从理论上证明将深度表征学习与探索过程解耦的有效性,验证了先前工作中观察到的实验现象。
  • 在标准假设下,为神经网络上下文多臂老虎机算法建立次线性遗憾上界。

提出的方法

  • 该算法使用深度 ReLU 神经网络将原始的上下文-动作特征向量映射到最后一层隐藏层的低维表征空间。
  • 仅在最后的线性层中使用上置信度(UCB)策略进行探索,从而最小化计算成本。
  • 利用神经正切核(NTK)理论分析在过参数化设置下深度网络的泛化性与收敛性。
  • 通过集中不等式与矩阵范数,对最后一层权重的估计误差进行上界估计,完成遗憾分析。
  • 算法维护一个协方差矩阵与最后一层参数的置信区间,以平衡探索与利用。
  • 理论分析结合了线性上下文多臂老虎机的技巧(如 Abbasi-Yadkori 等,2011 年)与基于 NTK 的泛化界。

实验结果

研究问题

  • RQ1是否可以在不需对整个深层网络进行探索的前提下,有效利用深度神经网络进行上下文多臂老虎机中的表征学习?
  • RQ2将表征学习与探索过程解耦,是否能带来更优的遗憾性能与更高的计算效率?
  • RQ3神经网络上下文多臂老虎机算法能否实现 $\backslash\text{widetilde{O}}(\backslash\text{sqrt{T}})$ 的遗憾,与最优线性 bandit 算法表现一致?
  • RQ4当探索被限制在深层网络的最后一层时,是否仍可实现理论上的 $\backslash\text{widetilde{O}}(\backslash\text{sqrt{T}})$ 遗憾上界?

主要发现

  • 所提出的 Neural-LinUCB 算法实现了 $\backslash\text{widetilde{O}}(\backslash\text{sqrt{T}})$ 的遗憾上界,与最优线性上下文多臂老虎机算法的遗憾率一致。
  • 与先前的神经 bandit 方法相比,该算法在计算上更加高效,因为探索仅限于最后一层,避免了对整个网络的优化。
  • 理论分析证实,深度表征学习与浅层 UCB 探索的结合可实现次线性遗憾,验证了先前工作中的经验观察。
  • 遗憾上界在标准假设下推导得出,包括有界特征范数与奖励中的次高斯噪声。
  • 分析利用神经正切核(NTK)理论,对过参数化设置下深层网络的泛化误差进行上界估计。
  • 在真实世界数据集上的实验结果表明,Neural-LinUCB 在显著低于全网络探索基线的计算成本下,实现了优异的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。