[论文解读] Policy Gradient Optimization of Thompson Sampling Policies
本文通过将后验参数抽取视为「伪动作」,采用策略梯度方法优化 Thompson 采样策略,使采样策略能够通过梯度方法高效调优。该方法在高臂或高噪声等具有挑战性的 bandit 场景中改进了 Thompson 采样,通过学习元参数减少过度探索,在数值实验中实现了显著的遗憾减少。
We study the use of policy gradient algorithms to optimize over a class of generalized Thompson sampling policies. Our central insight is to view the posterior parameter sampled by Thompson sampling as a kind of pseudo-action. Policy gradient methods can then be tractably applied to search over a class of sampling policies, which determine a probability distribution over pseudo-actions (i.e., sampled parameters) as a function of observed data. We also propose and compare policy gradient estimators that are specialized to Bayesian bandit problems. Numerical experiments demonstrate that direct policy search on top of Thompson sampling automatically corrects for some of the algorithm's known shortcomings and offers meaningful improvements even in long horizon problems where standard Thompson sampling is extremely effective.
研究动机与目标
- 为解决 Thompson 采样已知的缺陷,例如在短时 horizon 或高臂设置下过度探索,此时标准 TS 表现不佳。
- 开发一种方法,实现对 Thompson 采样策略的自动化、计算驱动的改进,超越启发式设计。
- 通过将决策重新定义为选择后验参数(伪动作)而非基础动作,实现对 Thompson 采样策略族的策略梯度优化。
- 证明学习元参数(如先验超参数或后验形状)可在贝叶斯 bandit 问题中带来显著性能提升。
提出的方法
- 将 Thompson 采样重构为两阶段过程:首先从策略依赖的后验中抽取参数(伪动作),然后在该参数下选择最优动作。
- 将抽取的参数视为决策变量,通过后验密度的闭式表达,使动作分布对策略梯度方法具有可处理性。
- 使用元参数(如先验方差、噪声分布形状)对采样策略进行参数化,从而实现对这些超参数的梯度优化。
- 使用专为贝叶斯 bandit 设计的策略梯度估计器,包括观察到的、平均的和贝叶斯遗憾等奖励度量,以及零基线、全知基线和自基线等基线。
- 采用批量策略梯度上升法,使用 Adam 优化器,通过从模拟 bandit 试验中估计的随机梯度更新元参数。
- 通过要求后验抽样分布对元参数的对数密度导数可计算,确保可处理性,通常在密度已知至比例常数时成立。
实验结果
研究问题
- RQ1尽管标准形式下动作分布难以处理,策略梯度方法是否能有效应用于优化 Thompson 采样策略?
- RQ2策略梯度估计中不同的奖励度量和基线如何影响所学 Thompson 采样策略的收敛性和性能?
- RQ3在已知 Thompson 采样表现不佳的场景(如多臂或高噪声)中,学习元参数(如先验方差、后验形状)能在多大程度上提升其性能?
- RQ4对采样策略直接进行策略搜索是否能自动纠正 Thompson 采样在长时 horizon 或极端设置下的过度探索问题?
- RQ5所提方法是否能在具有挑战性的 bandit 环境中实现与 Bayes-UCB 或 OGI 等成熟 bandit 算法相当或更优的性能?
主要发现
- 在高臂设置下(K=20, T=20),朴素 Thompson 采样因极端过度探索导致遗憾高达 28.802(标准误 0.097),表现欠佳。
- 使用平均奖励度量与全知基线时,经策略梯度优化的训练策略将遗憾降低至 20.348(标准误 0.126),显著优于朴素 TS。
- 所学策略通过随时间将拉动分布偏向更少的臂,有效减少了探索,如图 4 所示,初始的均匀分配逐渐转变为对特定臂的选择性聚焦。
- 不同奖励度量和基线的最终性能相似,但早期训练中零基线优于全知基线,表明全知基准并非紧密可及。
- 该方法成功学习到能重塑后验采样分布的元参数,纠正了 Thompson 采样在高维或冗余臂空间中过度探索的倾向。
- 该方法在测试设置中实现了接近最佳已知算法(如 OGI、Bayes-UCB)的性能,证明了自动化策略优化在贝叶斯 bandit 中的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。