Skip to main content
QUICK REVIEW

[论文解读] Nonparametric Contextual Bandits in an Unknown Metric Space

Nirandika Wanigasekara, Christina Lee Yu|arXiv (Cornell University)|Aug 3, 2019
Advanced Bandit Algorithms Research参考文献 22被引用 4
一句话总结

该论文提出了一种新颖的非参数上下文Bandit算法,能够在未知度量空间中学习动作之间的潜在相似性,从而实现对上下文-动作空间的自适应划分,提升学习效率。其遗憾界与奖励函数的局部几何结构相关,当δ-最优动作的测度随δ线性增长时,遗憾界为$O(\sqrt{KT})$,且无需事先了解动作度量或奖励结构。

ABSTRACT

Consider a nonparametric contextual multi-arm bandit problem where each arm $a \in [K]$ is associated to a nonparametric reward function $f_a: [0,1] o \mathbb{R}$ mapping from contexts to the expected reward. Suppose that there is a large set of arms, yet there is a simple but unknown structure amongst the arm reward functions, e.g. finite types or smooth with respect to an unknown metric space. We present a novel algorithm which learns data-driven similarities amongst the arms, in order to implement adaptive partitioning of the context-arm space for more efficient learning. We provide regret bounds along with simulations that highlight the algorithm's dependence on the local geometry of the reward functions.

研究动机与目标

  • 解决在具有大量动作且动作间结构关系未知的非参数上下文Bandit设置中实现高效学习的挑战。
  • 开发一种从数据中学习动作相似性而非依赖预设度量或核函数的算法。
  • 提供反映奖励函数局部几何结构的遗憾界,特别是当$\delta \to 0$时$\delta$-最优动作的测度变化。
  • 证明数据驱动的相似性学习相较于独立学习各动作或采用次优度量假设,能显著提升长期性能。

提出的方法

  • 将Slivkin的Zooming算法改进,根据从观测奖励中估计的成对动作相似性,动态划分上下文-动作空间。
  • 使用一种从奖励函数差异中推导出的数据驱动距离度量$\mathcal{D}_u^v(a,a')$,避免依赖预设度量。
  • 采用基于$n_t(\rho) \geq 4\ln(T)/\Delta^2$的标记规则,在区域中收集足够数据时触发子划分。
  • 引入聚类步骤,将具有相似奖励函数的动作分组,实现相似动作间的共享学习。
  • 实施自适应划分,提高接近最优策略区域的分辨率,从而在最关键区域提升估计精度。
  • 相似性估计使用参数$k=26$,$k$的选择对采样效率有显著影响。

实验结果

研究问题

  • RQ1在缺乏对底层度量空间先验知识的前提下,算法能否在非参数上下文Bandit设置中学习到有用的动作相似性?
  • RQ2当动作数量庞大且奖励函数相对于未知度量是光滑时,上下文Bandit算法的遗憾如何随时间变化?
  • RQ3数据驱动的相似性学习是否优于假设固定度量或独立学习各动作的方法?
  • RQ4算法性能如何依赖于奖励函数的局部几何结构,特别是$\delta$-最优动作的测度?

主要发现

  • 当$\delta$-最优动作的测度随$\delta$线性增长时,所提算法实现$O(\sqrt{KT})$遗憾界,表明其能有效适应局部奖励几何结构。
  • 仿真结果表明,该算法初期因相似性估计成本较高,但在长时 horizon 设置下显著优于独立动作学习和基于度量的基线方法。
  • 该算法在动作空间的保测变换下表现稳健,而依赖度量的算法则因度量选择不佳而性能下降。
  • 频率图显示,该算法随时间推移不断学习并优化策略,动作选择的形状逐渐与最优Zigzag策略对齐。
  • 使用真实距离的Oracle变体表现最佳,但使用数据驱动相似性的算法能紧密逼近其性能,证明自学习度量的有效性。
  • 采用固定度量表示(如$|\theta_a - \theta_{a'}|$)的算法收敛速度慢于真实距离,凸显了事先选择合适度量的困难。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。