Skip to main content
QUICK REVIEW

[论文解读] A Neural Networks Committee for the Contextual Bandit Problem

Robin Allesiardo, Raphaël Féraud|arXiv (Cornell University)|Sep 29, 2014
Advanced Bandit Algorithms Research参考文献 22被引用 10
一句话总结

该论文提出 NeuralBandit1,一种使用多个神经网络建模奖励概率的上下文多臂老虎机算法,无需假设线性关系或平稳数据。它引入了 NeuralBandit2 和 NeuralBandit3,采用对抗性多臂老虎机方法(EXP3)在线动态选择表现最佳的神经网络模型,累积遗憾低于 LinUCB、CTS 和 Banditron,尤其在非平稳数据条件下表现更优。

ABSTRACT

This paper presents a new contextual bandit algorithm, NeuralBandit, which does not need hypothesis on stationarity of contexts and rewards. Several neural networks are trained to modelize the value of rewards knowing the context. Two variants, based on multi-experts approach, are proposed to choose online the parameters of multi-layer perceptrons. The proposed algorithms are successfully tested on a large dataset with and without stationarity of rewards.

研究动机与目标

  • 解决现有上下文多臂老虎机算法中线性和平稳性假设的局限性。
  • 开发一种鲁棒的上下文多臂老虎机方法,以适应现实应用(如在线广告)中常见的非平稳数据分布。
  • 利用神经网络的通用逼近能力,建模复杂且非线性的奖励-上下文关系。
  • 引入基于对抗性多臂老虎机(EXP3)的模型选择机制,在线动态选择表现最佳的神经网络配置。
  • 在平稳和非平稳数据流上评估所提方法,以证明其鲁棒性和适应性。

提出的方法

  • 训练 K 个神经网络(每个动作一个),使用单隐层,以估计给定上下文下每个动作的奖励概率。
  • 使用随机梯度下降进行在线学习,以实现对变化的奖励分布的适应。
  • 应用 EXP3 算法,在多个预配置的神经网络模型(具有不同隐藏层大小和正则化参数)之间进行选择,以平衡探索与利用。
  • 在 NeuralBandit2 中,为每个动作维护一个独立的 EXP3 实例,以选择该动作的最佳模型。
  • 在 NeuralBandit3 中,允许每个动作拥有独立的模型选择机制,通过独立的 EXP3 实例实现,从而提升模型多样性与鲁棒性。
  • 基于观测到的奖励,使用随机梯度下降更新网络权重,同时使用 EXP3 的基于损失的反馈更新模型选择权重。

实验结果

研究问题

  • RQ1在非平稳环境中,具有动态模型选择的神经网络委员会能否优于线性和平稳的上下文多臂老虎机算法?
  • RQ2在共享(NeuralBandit2)与每个动作独立(NeuralBandit3)的模型选择之间,性能与对概念漂移的鲁棒性有何差异?
  • RQ3在复杂的真实世界数据流中,具有非凸损失函数的神经网络在遗憾性能上能否显著优于凸模型(如 LinUCB 和 CTS)?
  • RQ4使用对抗性多臂老虎机方法(EXP3)进行模型选择,能否实现对变化数据分布的有效在线适应?
  • RQ5在森林覆盖类型数据集的平稳与非平稳变体上,所提算法在收敛速度和累积遗憾方面表现如何?

主要发现

  • 在平稳数据上,NeuralBandit2 实现了最快的收敛速度和最低的累积遗憾(76% 分类准确率),优于 LinUCB(72%)、CTS(73%)和 Banditron(57%)。
  • 在每 500,000 次迭代发生概念漂移的非平稳数据上,NeuralBandit2 和 NeuralBandit3 的遗憾均低于 LinUCB 和 CTS,后者在首次漂移后无法适应。
  • NeuralBandit3 对概念漂移的鲁棒性优于 NeuralBandit2,因其可为每个动作利用多个独立模型,降低陷入次优局部极小值的风险。
  • Banditron 在平稳和非平稳数据上表现均较差,在最后 100,000 次预测中分类准确率仅为 57%,凸显了线性模型在复杂场景下的局限性。
  • 所提模型选择机制(使用 EXP3)实现了有效的在线适应,NeuralBandit2 和 NeuralBandit3 在每次概念漂移后 75,000 至 350,000 步内实现稳定。
  • 使用非凸神经网络模型可更好地表征复杂且非线性的奖励-上下文关系,尽管为此付出了失去理论遗憾边界的代价。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。