[论文解读] Deep Bayesian Bandits Showdown: An Empirical Comparison of Bayesian Deep Networks for Thompson Sampling
该论文基准评估了在情境赌博中用于汤姆森抽样的广泛近似贝叶斯神经网络方法,强调了不同后验近似如何影响在线决策。研究发现,某些方法在序列设置中表现不佳,而在顶部加上简单贝叶斯线性的方法则可以更鲁棒且易于调整。
Recent advances in deep reinforcement learning have made significant strides in performance on applications such as Go and Atari games. However, developing practical methods to balance exploration and exploitation in complex domains remains largely unsolved. Thompson Sampling and its extension to reinforcement learning provide an elegant approach to exploration that only requires access to posterior samples of the model. At the same time, advances in approximate Bayesian methods have made posterior approximation for flexible neural network models practical. Thus, it is attractive to consider approximate Bayesian neural networks in a Thompson Sampling framework. To understand the impact of using an approximate posterior on Thompson Sampling, we benchmark well-established and recently developed methods for approximate posterior sampling combined with Thompson Sampling over a series of contextual bandit problems. We found that many approaches that have been successful in the supervised learning setting underperformed in the sequential decision-making scenario. In particular, we highlight the challenge of adapting slowly converging uncertainty estimates to the online setting.
研究动机与目标
- 在深度序列决策中促进探索-开发权衡,并量化近似后验对情境赌博中汤姆森抽样的影响。
- 为汤姆森抽样提供对贝叶斯深度学习方法(变分推断、EP、 dropout、自举、噪声注入、高斯过程)的全面基准评估。
- 确定在不牺牲在线决策效率的前提下平衡不确定性估计准确性的实际算法。
- 就哪些后验近似在在线约束下具有可扩展性和良好表现提供指南。
提出的方法
- 实现带有多种后验近似族的汤姆森抽样(贝叶斯线性回归、对角协方差与全协方差、神经线性、神经贪婪、变分推断、期望传播、Dropout、蒙特卡洛方法、自举、直接噪声注入、高斯过程)。
- 使用具有共享的两隐藏层结构的神经网络来建模上下文到动作的奖励,输出按动作分开。
- 比较在线更新和培训计划(更新频率、小批量大小),以反映在线决策约束。
- 在合成和真实世界的情境赌博问题上进行评估,涵盖多个数据集(例如 Mushroom、Statlog、Covertype、Financial、Jester、Adult、Census、Song)。
- 在重新排列的试验中报告累积后悔和简单后悔,以评估不确定性估计的鲁棒性。
实验结果
研究问题
- RQ1在情境赌博中,不同的贝叶斯神经网络近似后验方法如何影响汤姆森抽样的性能?
- RQ2哪些后验近似策略在在线情况下具备可扩展性并为序列决策提供鲁棒的不确定性估计?
- RQ3在在线带带环境中,更简单的方法(例如在学习到的表示上方的贝叶斯线性回归)是否优于更复杂的贝叶斯神经网络近似?
- RQ4在线数据反馈回路如何影响后验近似的质量与后悔结果?
主要发现
- Dropout、简单的噪声注入和自举在某些任务上可以提升表现,但可能无法解决具有挑战性的探索问题。
- 许多复杂的后验方法(变分推断、黑盒 alpha-散度、小批量 MCMC)将表示学习与不确定性紧密耦合,可能会妨碍在线决策。
- 对最后一层表示进行贝叶斯线性回归(Neural Linear)提供鲁棒、易于调优的不确定性,在若干情境下具有很强的基线性能。
- 对角协方差近似在高维问题中可能导致显著的后悔,因为在众多维度上过度探索,而更具表现力的近似可能缓解这一点。
- 论文指出,由于序列数据收集中的反馈循环,后验质量并不总是能预测在线性能。
- 在真实世界数据集上的实证结果显示各算法表现各异,且没有单一方法能在所有问题上占优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。