[论文解读] Thompson Sampling with Approximate Inference
本文研究了在k-armed bandits中使用近似推理的Thompson采样,表明α-散度中的微小恒定误差会导致线性遗憾,原因在于探索不足或过度探索。本文提出强制探索机制以恢复次线性遗憾,尤其在α ≤ 0时,即使存在较大的推理误差亦能实现,理论分析与基于集成采样和变分推理的仿真结果验证了该方法的有效性。
We study the effects of approximate inference on the performance of Thompson sampling in the $k$-armed bandit problems. Thompson sampling is a successful algorithm for online decision-making but requires posterior inference, which often must be approximated in practice. We show that even small constant inference error (in $α$-divergence) can lead to poor performance (linear regret) due to under-exploration (for $α<1$) or over-exploration (for $α>0$) by the approximation. While for $α> 0$ this is unavoidable, for $α\leq 0$ the regret can be improved by adding a small amount of forced exploration even when the inference error is a large constant.
研究动机与目标
- 研究近似后验推理对k-armed bandit问题中Thompson采样性能的影响。
- 识别出微小推理误差导致线性遗憾的条件,原因在于探索不足或过度探索。
- 提出并分析一种强制探索机制,当推理误差较大时可恢复次线性遗憾。
- 通过理论分析与集成采样和变分推理的仿真验证理论结果。
提出的方法
- 使用α-散度作为真实后验Πt与近似后验Qt之间推理误差的一般度量。
- 在频率学派与贝叶斯设定下分析遗憾,区分探索不足(α < 1)与过度探索(α > 0)。
- 引入一种强制探索策略——在随机时间间隔内进行均匀采样,以确保后验集中并实现次线性遗憾。
- 将该方法应用于现有算法(如集成采样和平均场变分推理),并展示改进的遗憾界。
- 利用KL散度和后验集中性的理论界,证明在强制探索下遗憾为次线性。
- 通过使用高斯先验和似然函数的仿真,比较精确Thompson采样、近似推理与强制探索变体的性能。
实验结果
研究问题
- RQ1真实后验与近似后验之间α-散度的微小恒定误差是否会导致Thompson采样中出现线性遗憾?
- RQ2在k-armed bandit设置中,由于推理误差导致的过度探索(α > 0)或探索不足(α < 1)是否会导致线性遗憾?
- RQ3当推理误差较大时,强制探索是否能恢复次线性遗憾,特别是对于α ≤ 0的情况?
- RQ4集成采样和变分推理等近似推理方法在引入强制探索后性能如何变化?
- RQ5在近似推理下,确保后验集中与次线性遗憾的理论条件是什么?
主要发现
- 无论先验为何,α-散度中微小的恒定推理误差都会导致Thompson采样出现线性遗憾,原因在于持续的探索不足或过度探索。
- 当α > 0时,线性遗憾源于过度探索,因为近似无法集中于最优动作。
- 当α < 1且在较弱的先验条件下,线性遗憾源于探索不足,即后验无法集中于真实最优动作。
- 当α ≤ 0时,添加强制探索(均匀采样)可恢复后验集中性并确保次线性遗憾,即使存在较大的恒定推理误差。
- 理论分析表明,若α-散度中的近似误差有界且应用了强制探索,则遗憾在T上为次线性。
- 仿真与理论分析均表明,强制探索可提升集成采样与平均场变分推理的性能,实现O(log T)模型数量下的次线性遗憾。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。