Skip to main content
QUICK REVIEW

[论文解读] Scalable Thompson Sampling via Optimal Transport

Ruiyi Zhang, Zheng Wen|arXiv (Cornell University)|Feb 19, 2019
Machine Learning and Algorithms被引用 8
一句话总结

本文提出 π-TS,一种可扩展的 Thompson 采样框架,利用 Wasserstein 梯度流对基于粒子的后验近似进行优化,且无需显式分布假设。通过将后验推断建模为在概率测度上的凸优化问题,π-TS 在复杂模型(如神经网络)的大规模上下文 bandit 问题中实现了更优的不确定性估计与性能表现,优于包括变分推断和线性模型在内的基线方法,在合成数据与真实世界数据集上均表现出色。

ABSTRACT

Thompson sampling (TS) is a class of algorithms for sequential decision-making, which requires maintaining a posterior distribution over a model. However, calculating exact posterior distributions is intractable for all but the simplest models. Consequently, efficient computation of an approximate posterior distribution is a crucial problem for scalable TS with complex models, such as neural networks. In this paper, we use distribution optimization techniques to approximate the posterior distribution, solved via Wasserstein gradient flows. Based on the framework, a principled particle-optimization algorithm is developed for TS to approximate the posterior efficiently. Our approach is scalable and does not make explicit distribution assumptions on posterior approximations. Extensive experiments on both synthetic data and real large-scale data demonstrate the superior performance of the proposed methods.

研究动机与目标

  • 解决在神经网络等复杂模型中 Thompson 采样时后验近似可扩展性的挑战,其中精确推断不可行。
  • 通过引入粒子间相互作用,克服现有基于粒子的方法中粒子独立处理的局限,以提升后验近似的质量。
  • 开发一种无需对后验分布假设特定参数形式的高效且有理论依据的后验近似框架。
  • 在大规模真实世界数据集和动态决策场景中证明所提方法的有效性。
  • 通过 Wasserstein 梯度流提供一种理论基础坚实的后验采样方法,确保分布近似的最优性。

提出的方法

  • 利用 Wasserstein 梯度流(WGF)在概率测度空间上将 Thompson 采样中的后验近似建模为凸优化问题。
  • 通过在 Wasserstein 流形上的离散梯度流演化一组粒子来近似后验分布。
  • 在更新规则中引入基于核函数的相互作用项,实现粒子间的集体优化以改进后验近似质量。
  • 推导出粒子更新规则(公式 5),该规则结合了局部梯度下降与基于粒子间距离和核函数的成对相互作用。
  • 引入基于扩散的正则化项以稳定粒子动力学,防止优化过程中的坍塌或退化现象。
  • 通过在每个决策步长中采样一个粒子,将粒子交互式后验近似集成到 Thompson 采样中,确保通过不确定性感知采样实现探索。

实验结果

研究问题

  • RQ1与独立粒子方法相比,通过 Wasserstein 梯度流实现的粒子交互式优化是否能提升 Thompson 采样中的后验近似质量?
  • RQ2在大规模上下文 bandit 问题中,所提出的 π-TS 框架是否在 regret 性能上优于 VI-TS、Neural-Linear 和 Lin-TS 等现有基线方法?
  • RQ3在高维或非 i.i.d. 观测设置下,π-TS 在多大程度上保持了不确定性校准并降低了 regret 方差?
  • RQ4与表示能力有限或不确定性估计较差的模型相比,π-TS 在具有复杂奖励结构的真实世界数据集上的表现如何?
  • RQ5基于 WGF 的框架是否可应用于深度神经网络等复杂模型,且无需对后验分布做显式分布假设?

主要发现

  • 在线性与稀疏线性 bandit 设置中,π-TS-DGF 的 regret 性能几乎与 Lin-TS(精确后验)相当,显著优于 Neural-Linear 和 VI-TS。
  • 在真实世界数据集(Statlog、Covertype、Adult、Census、Financial、Mushroom)上,π-TS 在所有设置中均实现了最低的归一化累计 regret,且在更大数据集上表现出一致的性能优势。
  • VI-TS 因对不确定性的低估而表现出较高的 regret 方差和较差的性能,而 π-TS 通过粒子间相互作用维持了更优的不确定性校准。
  • 随着数据量增加,π-TS 与 Lin-TS 之间的性能差距逐渐缩小,表明 π-TS 能够有效捕捉 Lin-TS 无法建模的复杂后验结构。
  • Neural-Linear 因特征表示能力提升而优于 Lin-TS,但仍显著落后于 π-TS,尤其在神经特征表现不佳时。
  • π-TS 中的粒子交互机制在所有评估场景中均表现出更低的 regret 和方差,证明其带来了更稳定、更精确的后验近似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。