Skip to main content
QUICK REVIEW

[论文解读] Quantum exploration algorithms for multi-armed bandits

Daochen Wang, Xuchen You|arXiv (Cornell University)|Jul 14, 2020
Quantum Computing Algorithms and Architecture参考文献 61被引用 5
一句话总结

本文提出了一种用于多臂赌博机中最佳臂识别的量子算法,利用对奖励概率的相干量子预言机访问(将奖励概率编码为量子振幅)。通过利用可变时间振幅放大与估计,该算法实现了 $\tilde{O}\bigl(\sqrt{\sum_{i=2}^{n}\Delta^{-2}_{i}}\bigr)$ 的查询复杂度,相较于最佳经典算法实现了二次量子加速,且在多对数因子范围内达到了匹配的量子下界。

ABSTRACT

Identifying the best arm of a multi-armed bandit is a central problem in bandit optimization. We study a quantum computational version of this problem with coherent oracle access to states encoding the reward probabilities of each arm as quantum amplitudes. Specifically, we show that we can find the best arm with fixed confidence using $ ilde{O}\bigl(\sqrt{\sum_{i=2}^nΔ^{\smash{-2}}_i}\bigr)$ quantum queries, where $Δ_{i}$ represents the difference between the mean reward of the best arm and the $i^ ext{th}$-best arm. This algorithm, based on variable-time amplitude amplification and estimation, gives a quadratic speedup compared to the best possible classical result. We also prove a matching quantum lower bound (up to poly-logarithmic factors).

研究动机与目标

  • 在相干量子预言机访问条件下,建立多臂赌博机中最佳臂识别问题的量子加速。
  • 分析在量子环境下以固定置信度识别最佳臂的查询复杂度。
  • 开发一种在查询复杂度方面相较于经典方法实现二次改进的算法。
  • 证明匹配的量子下界,确认所提算法在多对数因子范围内的最优性。

提出的方法

  • 该算法使用可变时间振幅放大,根据最佳臂与其他臂之间的差异 $\Delta_i = p_1 - p_i$ 高效地放大最佳臂的振幅。
  • 利用量子振幅估计,以比经典采样更少的查询次数高精度估计奖励概率 $p_i$。
  • 量子预言机 $\mathcal{O}$ 提供对奖励概率作为量子振幅的相干访问,支持对所有臂的叠加。
  • 该算法被设计为对预言机中常见的“杂项”状态具有鲁棒性。
  • 分析依赖于柯西-施瓦茨不等式以及对振幅差异的界,推导出查询复杂度的界。
  • 通过归约为态 distinguishability 问题,证明了量子下界,表明该算法在对数因子范围内最优。

实验结果

研究问题

  • RQ1在具有相干预言机访问的情况下,量子算法能否在多臂赌博机的最佳臂识别中实现可证明的加速?
  • RQ2以固定置信度识别最佳臂的最优量子查询复杂度是多少?
  • RQ3该量子算法的性能如何随最佳臂与其他臂之间的间隙 $\Delta_i$ 变化?
  • RQ4所提出的量子算法是否最优,还是可以在查询复杂度上实现进一步改进?
  • RQ5当预言机在计算中引入“杂项”状态时,量子加速是否仍能保持?

主要发现

  • 所提量子算法实现了 $\tilde{O}\bigl(\sqrt{\sum_{i=2}^{n}\Delta^{-2}_{i}}\bigr)$ 的查询复杂度,相较于最佳经典算法实现了二次加速。
  • 该算法在多对数因子范围内最优,因为已证明匹配的量子下界为 $\Omega\bigl(\sqrt{\sum_{i=2}^{n}\Delta^{-2}_{i}}\bigr)$。
  • 即使量子预言机在辅助寄存器中引入任意“杂项”状态,该算法仍保持鲁棒性,这在实际实现中很常见。
  • 分析表明,只要间隙 $\Delta_i$ 与零保持有界距离,即使奖励概率受到有界扰动,量子加速仍能保持。
  • 该结果表明,量子算法可显著加速基于赌博机反馈的主动学习与推荐系统。
  • 该框架可应用于加速依赖于类似预言机模型的现有聚类与强化学习量子算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。