[论文解读] Neural Contextual Bandits with Upper Confidence Bound-Based Exploration
本文提出 NeuralUCB,一种基于神经网络的上下文Bandit算法,利用深度神经网络学习表征,并构建置信上界(UCB)以实现探索。在标准假设下,其遗憾为 $ ilde{O}( ext{sqrt}{T})$,标志着首个具有近似最优遗憾保证的神经网络上下文Bandit算法。
We study the stochastic contextual bandit problem, where the reward is generated from an unknown function with additive noise. No assumption is made about the reward function other than boundedness. We propose a new algorithm, NeuralUCB, which leverages the representation power of deep neural networks and uses a neural network-based random feature mapping to construct an upper confidence bound (UCB) of reward for efficient exploration. We prove that, under standard assumptions, NeuralUCB achieves $ ilde O(\sqrt{T})$ regret, where $T$ is the number of rounds. To the best of our knowledge, it is the first neural network-based contextual bandit algorithm with a near-optimal regret guarantee. We also show the algorithm is empirically competitive against representative baselines in a number of benchmarks.
研究动机与目标
- 解决基于神经网络的上下文Bandit算法中缺乏遗憾保证的问题。
- 开发一种方法,利用深度神经网络在随机上下文Bandit中进行表征学习。
- 通过置信上界机制实现高效探索,且对奖励函数无强假设。
- 在奖励函数无参数假设的情况下,实现近似最优的遗憾性能。
- 在基准环境上展示其与现有最先进基线方法相比的实证竞争力。
提出的方法
- 使用深度神经网络从上下文学习到低维表征的随机特征映射。
- 基于神经网络的预测结果和不确定性估计,构建期望奖励的置信上界(UCB)。
- 在随机上下文Bandit设置中应用UCB原则,以平衡探索与利用。
- 确保UCB构建对奖励中的加性噪声具有鲁棒性,仅需对奖励函数施加有界性假设。
- 利用标准泛化与集中不等式边界,推导出在弱假设下的遗憾保证。
- 利用神经网络的输出同时估计期望奖励及其不确定性,从而实现有原则的探索。
实验结果
研究问题
- RQ1基于神经网络的上下文Bandit算法是否能在不施加奖励函数强参数假设的情况下实现近似最优遗憾?
- RQ2如何在Bandit设置中有效结合深度表征学习与置信上界探索?
- RQ3在标准假设下,基于神经网络的上下文Bandit算法可建立何种理论遗憾边界?
- RQ4所提方法在性能与样本效率方面与现有基线相比如何?
- RQ5是否可能在使用深度神经网络的表达能力的同时,仍保持理论保证?
主要发现
- NeuralUCB 在标准假设下实现 $\tilde{O}(\text{sqrt}{T})$ 遗憾,首次为基于神经网络的上下文Bandit算法建立了近似最优遗憾保证。
- 该算法利用深度神经网络学习上下文表征,且无需事先了解奖励函数的结构。
- 该方法通过基于神经网络不确定性估计构建的置信上界,确保了高效的探索。
- 实证评估表明,NeuralUCB 在多个基准环境中的表现与最先进基线方法相当。
- 遗憾边界仅在奖励函数有界性假设下推导得出,无需参数化或光滑性条件。
- 理论分析确认,该算法在回合数 T 增加时具有有利的可扩展性,其遗憾接近信息论下限,仅相差对数因子。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。