Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning Using Quantum Boltzmann Machines

Daniel J. Crawford, Anna Levit|arXiv (Cornell University)|Dec 17, 2016
Stochastic Gradient Optimization Techniques被引用 16
一句话总结

本文提出一种基于量子玻尔兹曼机(QBMs)的强化学习框架,通过模拟量子退火(SQA)进行训练,利用深度玻尔兹曼机(DBM)架构建模状态-动作依赖关系。结果表明,采用横向场的QBM-RL在学习马尔可夫决策过程的最优策略方面优于经典RBMs与DBMs方法,尤其在复杂迷宫环境中表现更优,归因于更高效的采样能力和在高维状态空间中的更好泛化性能。

ABSTRACT

We investigate whether quantum annealers with select chip layouts can outperform classical computers in reinforcement learning tasks. We associate a transverse field Ising spin Hamiltonian with a layout of qubits similar to that of a deep Boltzmann machine (DBM) and use simulated quantum annealing (SQA) to numerically simulate quantum sampling from this system. We design a reinforcement learning algorithm in which the set of visible nodes representing the states and actions of an optimal policy are the first and last layers of the deep network. In absence of a transverse field, our simulations show that DBMs are trained more effectively than restricted Boltzmann machines (RBM) with the same number of nodes. We then develop a framework for training the network as a quantum Boltzmann machine (QBM) in the presence of a significant transverse field for reinforcement learning. This method also outperforms the reinforcement learning method that uses RBMs.

研究动机与目标

  • 探究特定量子比特布局的量子退火器是否能在强化学习任务中超越经典系统。
  • 设计一种基于量子玻尔兹曼机启发的深度网络结构的强化学习算法。
  • 在模拟量子退火条件下,评估DBMs与QBMs在学习马尔可夫决策过程最优策略方面的性能。
  • 比较QBM-RL、DBM-RL与RBM-RL在迷宫复杂度递增时的学习效率与策略保真度。
  • 通过改进采样与表征学习,评估强化学习中实现量子优势的潜力。

提出的方法

  • 作者将强化学习问题映射为具有深度玻尔兹曼机(DBM)类量子比特布局的横向场伊辛哈密顿量。
  • 他们使用模拟量子退火(SQA)在演化过程中从哈密顿量的瞬时量子分布中采样。
  • DBM的可见层表示状态与动作,隐藏层则建模潜在的状态-动作相关性。
  • 通过在RBM/DBM/QBM参数上使用梯度下降最小化收缩映射算子的连续应用之间的距离来学习策略。
  • 训练使用SQA采样所得节点激活的期望值,同时调整横向场强度以模拟量子退火动力学。
  • 该方法将基于经典RBM的学习与基于DBM和QBM的方法进行比较,其中QBM在最终阶段包含显著的横向场(Γf = 2.00)。

实验结果

研究问题

  • RQ1通过模拟量子退火训练的量子玻尔兹曼机是否能在强化学习任务中超越经典受限与深度玻尔兹曼机?
  • RQ2哈密顿量中引入横向场是否能提升复杂环境中策略学习的保真度与收敛速度?
  • RQ3DBM与QBM在强化学习中的性能如何随迷宫尺寸与任务复杂度的增加而变化?
  • RQ4与RBM相比,DBM所建模的高阶依赖关系在多大程度上提升了策略学习性能?
  • RQ5在训练深度生成模型用于强化学习时,使用量子采样(通过SQA)相比经典采样是否具有可测量的优势?

主要发现

  • 在所有迷宫尺寸下,采用最终横向场强度Γf = 2.00的QBM-RL在策略学习保真度方面均优于DBM-RL与RBM-RL。
  • DBM-RL即使在隐藏节点数量相同的情况下,其保真度仍高于RBM-RL,归因于对高阶相关性的更好建模。
  • 随着迷宫尺寸增大,RBM-RL的平均保真度(avℓ)迅速衰减至随机策略水平,而DBM-RL与QBM-RL始终保持高性能。
  • 即使训练样本为均匀随机选择(消除了有序扫描带来的周期性效应),QBM-RL的保真度曲线仍持续优于DBM-RL与RBM-RL。
  • 当Γf = 0.01时,SQA产生的保真度曲线与经典模拟退火(SA)一致,证实了在横向场趋近于零的极限下,与经典玻尔兹曼采样的一致性。
  • 结果表明,QBM-RL具有实现量子优势的潜力,因为基于RBM的方法可能需要指数级更大的网络架构才能解决更大规模的迷宫问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。