Skip to main content
QUICK REVIEW

[论文解读] Online Learning with Gaussian Payoffs and Side Observations

Yifan Wu, András György|arXiv (Cornell University)|Oct 27, 2015
Advanced Bandit Algorithms Research参考文献 8被引用 9
一句话总结

本文提出了一种新颖的在线学习框架,采用高斯收益与侧向观测,其中反馈质量通过方差依赖于动作对。该工作建立了首个非渐近、问题相关的后悔下界,并提出了能够以常数因子逼近这些下界的算法,统一并改进了以往在部分监控与图结构反馈设置中的结果。

ABSTRACT

We consider a sequential learning problem with Gaussian payoffs and side information: after selecting an action $i$, the learner receives information about the payoff of every action $j$ in the form of Gaussian observations whose mean is the same as the mean payoff, but the variance depends on the pair $(i,j)$ (and may be infinite). The setup allows a more refined information transfer from one action to another than previous partial monitoring setups, including the recently introduced graph-structured feedback case. For the first time in the literature, we provide non-asymptotic problem-dependent lower bounds on the regret of any algorithm, which recover existing asymptotic problem-dependent lower bounds and finite-time minimax lower bounds available in the literature. We also provide algorithms that achieve the problem-dependent lower bound (up to some universal constant factor) or the minimax lower bounds (up to logarithmic factors).

研究动机与目标

  • 形式化一种新的在线学习模型,其中高斯收益与侧向观测存在,反馈质量通过方差参数随动作对而变化。
  • 推导出在全信息设置之外的随机部分监控中,首个非渐近、问题相关的后悔下界。
  • 设计能够以通用常数因子逼近这些下界的算法,并匹配最小最大后悔率(对数因子内)。
  • 通过允许非自观测与可变反馈质量,推广先前的图结构反馈模型。
  • 弥合现有渐近问题相关边界与随机部分监控中有限时间性能保证之间的差距。

提出的方法

  • 该模型假设选择动作 $i$ 会为所有动作 $j$ 产生均值为 $\theta_j$、方差为 $\sigma^2_{ij}$ 的高斯侧向观测,从而允许反馈质量可变。
  • 本文推导出依赖于收益差异与观测方差的非渐近、问题相关的后悔下界,作为先前渐近与最小最大边界的特例被恢复。
  • 关键技术部分涉及利用集中不等式与方差相关的信息界,分析观测质量、时间范围与估计精度之间的相互作用。
  • 首个算法在渐近意义下实现问题相关的后悔,其性能与下界相差一个与问题无关的乘法常数。
  • 第二个算法在强可观测性与弱可观测性条件下,均以对数因子逼近最小最大后悔,其问题相关后悔为 $O(\log^{3/2}T)$。
  • 分析基于事件集 $V_r$ 与 $V_r^c$ 将后悔分解为多个阶段,并通过控制每个动作的最小观测次数来约束后悔的增长。

实验结果

研究问题

  • RQ1当反馈质量因动作对而异时,在具有高斯收益与侧向观测的在线学习中,后悔的根本极限是什么?
  • RQ2能否为全信息情形之外的随机部分监控建立非渐近、问题相关的后悔下界?
  • RQ3是否存在算法在问题相关设置下,以常数因子逼近这些下界?
  • RQ4在该广义反馈模型中,不同可观测性模式(强与弱)下,最小最大后悔如何随时间尺度变化?
  • RQ5所提出的框架能否统一并改进现有图结构反馈与部分监控中的结果?

主要发现

  • 本文首次为具有高斯收益与侧向观测的随机部分监控建立了非渐近、问题相关的后悔下界。
  • 这些下界在通用常数因子内恢复了现有的渐近问题相关与有限时间最小最大边界。
  • 所提出的算法在问题相关下界上以一个通用常数因子实现逼近,极限下与渐近下界一致。
  • 另一个算法在强与弱可观测性条件下,均以对数因子逼近最小最大后悔。
  • 第二个算法的问题相关后悔为 $O(\log^{3/2}T)$,优于先前未匹配渐近下界或最小最大率的结果。
  • 分析表明,最终的后悔界中可将时间范围 $T$ 替换为常数,表明关键决策轮次的数量与 $T$ 无关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。