Skip to main content
QUICK REVIEW

[论文解读] Differentiable Bandit Exploration

Craig Boutilier, Chih‐Wei Hsu|arXiv (Cornell University)|Feb 17, 2020
Advanced Bandit Algorithms Research参考文献 46被引用 5
一句话总结

本文提出了一种可微分的、基于梯度的贝叶斯多臂老虎机最优探索策略学习方法,通过在问题实例分布上优化贝叶斯奖励来实现。该方法提出了一种新型可微分的Softmax策略——SoftElim,并使用带有方差减少的策略梯度方法训练神经网络及其他策略,在实现比标准基线更低的贝叶斯遗憾的同时,能够从数据分布中学习隐式偏好。

ABSTRACT

Exploration policies in Bayesian bandits maximize the average reward over problem instances drawn from some distribution $\mathcal{P}$. In this work, we learn such policies for an unknown distribution $\mathcal{P}$ using samples from $\mathcal{P}$. Our approach is a form of meta-learning and exploits properties of $\mathcal{P}$ without making strong assumptions about its form. To do this, we parameterize our policies in a differentiable way and optimize them by policy gradients, an approach that is general and easy to implement. We derive effective gradient estimators and introduce novel variance reduction techniques. We also analyze and experiment with various bandit policy classes, including neural networks and a novel softmax policy. The latter has regret guarantees and is a natural starting point for our optimization. Our experiments show the versatility of our approach. We also observe that neural network policies can learn implicit biases expressed only through the sampled instances.

研究动机与目标

  • 开发一种通用的、可微分的框架,用于学习老虎机探索策略,而无需对先验分布P施加强假设。
  • 通过策略梯度方法优化策略以实现最大贝叶斯奖励,从而支持通过随机优化进行端到端训练。
  • 设计一种新型可微分的老虎机策略SoftElim,具有可证明的次线性遗憾且易于优化。
  • 证明神经网络能够通过策略梯度训练学习数据分布中的隐式偏好。
  • 通过问题特定基线和新型方差减少技术,降低老虎机策略优化中的梯度方差。

提出的方法

  • 使用可微分函数(包括神经网络和一种新型Softmax策略)来参数化老虎机策略,其中动作概率取决于估计的次优性差距和计数。
  • 将贝叶斯奖励表述为从未知先验P中采样问题实例后的累积奖励期望,并通过策略梯度方法进行优化。
  • 利用似然比技巧推导奖励梯度,并引入两种方差减少基线:自基线(self-baseline)和最优事后基线(optimal hindsight baseline),专为老虎机设置设计。
  • 提出SoftElim,一种可微分策略,其中拉动臂i的概率与exp(θ × (max_j μ_j - μ_i)^2 × T_i)成正比,实现乐观探索并具有理论遗憾保证。
  • 通过采样轨迹的梯度经验估计,并应用随机梯度上升来训练策略参数。
  • 在合成和真实世界老虎机问题上评估该方法,与UCB1、Thompson Sampling和Exp3进行性能比较。

实验结果

研究问题

  • RQ1我们能否通过使用可微分策略梯度优化贝叶斯奖励,来学习有效的贝叶斯老虎机探索策略?
  • RQ2像SoftElim这样的可微分Softmax策略是否能在保持对梯度优化友好性的同时实现次线性遗憾?
  • RQ3专为老虎机结构设计的方差减少技术在提升样本效率和策略梯度训练收敛性方面有多有效?
  • RQ4神经网络策略是否能在无显式监督的情况下学习先验分布P中的复杂隐式偏好?
  • RQ5贝叶斯奖励目标在策略参数上是否为凹函数,从而在梯度上升下提供收敛性保证?

主要发现

  • 所提出的GradBand方法在各种问题实例上成功学习到的老虎机策略,其贝叶斯遗憾低于UCB1、Thompson Sampling和Exp3。
  • SoftElim策略在θ=8时实现O(1)的遗憾常数,显著优于先前工作的O(KΔ⁻⁴)上界,且可通过梯度下降轻松优化。
  • 通过策略梯度训练的神经网络策略能够忽略次优臂并聚焦于相关臂,展示了从数据分布中捕捉隐式偏好的能力。
  • 使用事后最优基线(b^opt)和自基线显著降低了梯度方差,提升了训练稳定性和收敛速度。
  • 实证结果表明,当使用基于RNN的策略时,贝叶斯遗憾不会随臂的数量K增加而上升,而经典算法则会,这是由于策略学习到了对相关臂的关注。
  • 该方法在包括具有结构化或高维先验的多样化老虎机问题上泛化良好,表明其具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。