Skip to main content
QUICK REVIEW

[论文解读] Thompson Sampling Algorithms for Mean-Variance Bandits

Qiuyu Zhu, Vincent Y. F. Tan|arXiv (Cornell University)|Feb 1, 2020
Advanced Bandit Algorithms Research参考文献 21被引用 14
一句话总结

本文提出了针对高斯分布多臂赌博机的新型基于Thompson Sampling的算法——MTS、VTS、MVTS,以及针对伯努利分布多臂赌博机的BMVTS算法,用于均值-方差多臂赌博机问题,实现风险感知的决策。作者提供了紧致的遗憾界,其在某些参数范围内与信息论下限一致,并通过仿真表明,其算法在所有风险容忍度下均显著优于现有的LCB基方法。

ABSTRACT

The multi-armed bandit (MAB) problem is a classical learning task that exemplifies the exploration-exploitation tradeoff. However, standard formulations do not take into account {\em risk}. In online decision making systems, risk is a primary concern. In this regard, the mean-variance risk measure is one of the most common objective functions. Existing algorithms for mean-variance optimization in the context of MAB problems have unrealistic assumptions on the reward distributions. We develop Thompson Sampling-style algorithms for mean-variance MAB and provide comprehensive regret analyses for Gaussian and Bernoulli bandits with fewer assumptions. Our algorithms achieve the best known regret bounds for mean-variance MABs and also attain the information-theoretic bounds in some parameter regimes. Empirical simulations show that our algorithms significantly outperform existing LCB-based algorithms for all risk tolerances.

研究动机与目标

  • 为风险感知的均值-方差多臂赌博机问题中缺乏基于Thompson Sampling的算法提供解决方案。
  • 开发在弱于先前工作的假设下仍能运行的算法,避免对奖励分布为次高斯的假设要求。
  • 实现与现有结果相匹配或更一般化的遗憾界,包括信息论下限。
  • 通过实证验证,所提算法在各种风险容忍度下均优于最先进LCB基算法。

提出的方法

  • 为高斯分布赌博机提出MTS、VTS和MVTS算法,每种算法针对不同的风险与方差情形进行优化。
  • 提出BMVTS,一种适用于伯努利分布奖励的Thompson Sampling变体,将该框架扩展至二值结果场景。
  • 采用新颖的反浓度不等式(引理3和引理4)分析遗憾,无需次高斯假设。
  • 使用基于Markowitz均值-方差准则的鲁棒风险厌恶目标函数,结合均值与方差。
  • 利用集中不等式与尾部概率分析,推导有限时间遗憾界。
  • 通过理论分析表明,在特定参数范围内,遗憾界与信息论下限一致。

实验结果

研究问题

  • RQ1在一般奖励分布下,Thompson Sampling能否被有效适配至均值-方差多臂赌博机?
  • RQ2所提算法是否实现了与信息论下限相匹配或接近的遗憾界?
  • RQ3算法是否能在所有风险容忍度水平下均优于现有LCB基方法?
  • RQ4在非次高斯设定下,遗憾界如何随时间及最优与次优臂之间差距的变化而变化?
  • RQ5当奖励分布为高斯或伯努利分布时,Thompson Sampling在均值-方差赌博机中的理论保证为何?

主要发现

  • 所提MVTS算法在均值-方差MAB问题中实现了最佳已知遗憾界,并在某些参数范围内与信息论下限一致。
  • 对于高斯分布赌博机,算法在无需次高斯假设的前提下,推广了Agrawal & Goyal(2012)的先前结果。
  • 针对伯努利分布赌博机的BMVTS算法,实现了有限时间遗憾界,其主导项为O(log n),并包含1/ε的多项式项。
  • 实验结果表明,MVTS在所有测试的风险容忍度水平(ρ)下均持续优于LCB基算法。
  • 理论分析揭示,遗憾依赖于最优臂的均值与方差之差以及风险参数ρ,通过新型反浓度不等式推导出更紧的界限。
  • BMVTS的有限时间遗憾界包含O(1/ε²)和O(1/ε)量级的项,通过选择ε = (log n)^(-1/4)可控制这些项,从而实现渐近遗憾O(log n)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。