[论文解读] Free energy-based reinforcement learning using a quantum processor
本文提出了一种基于自由能的强化学习(FERL)框架,利用D-Wave 2000Q量子退火机从横向场伊辛模型中采样,实现了对量子玻尔兹曼机(QBM)中自由能的高效近似。该方法通过复制堆叠技术将量子测量结果映射为有效经典构型,在网格世界任务中展现出优于经典FERL和DQN基线的早期学习性能。
Recent theoretical and experimental results suggest the possibility of using current and near-future quantum hardware in challenging sampling tasks. In this paper, we introduce free energy-based reinforcement learning (FERL) as an application of quantum hardware. We propose a method for processing a quantum annealer's measured qubit spin configurations in approximating the free energy of a quantum Boltzmann machine (QBM). We then apply this method to perform reinforcement learning on the grid-world problem using the D-Wave 2000Q quantum annealer. The experimental results show that our technique is a promising method for harnessing the power of quantum sampling in reinforcement learning tasks.
研究动机与目标
- 探究当前量子硬件——特别是D-Wave 20000Q量子退火机——在强化学习任务中的可行性。
- 通过从测量的量子比特自旋构型中近似量子玻尔兹曼机(QBM)的自由能,解决在强化学习中利用量子采样的挑战。
- 开发一种方法,将量子退火机的输出视为经典伊辛模型的有效样本,从而实现与现有基于自由能的学习框架的集成。
- 评估量子增强型FERL相对于经典基线的性能,特别是在早期学习阶段的效率。
- 验证假设:当通过有效经典构型正确映射时,量子采样可在强化学习中优于经典采样。
提出的方法
- 利用Suzuki-Trotter分解将量子退火过程映射为高维经典伊辛模型,使量子测量可被解释为副本。
- 应用复制堆叠技术,从D-Wave 20000Q的多次测量中生成有效经典构型,将量子设备视为QBM的采样预言机。
- 基于从量子样本中导出的有效经典伊辛模型的能量,采用基于自由能的Q函数近似方法。
- 使用深度玻尔兹曼机(DBM)或受限玻尔兹曼机(RBM)参数化Q函数,学习过程由基于自由能近似的时序差分(TD)更新引导。
- 使用模拟退火(SA)和量子退火(SQA)作为基线进行性能比较,各方法使用相同的虚拟参数(β = 2.0,Γ = 0.5)。
- 通过将D-Wave 20000Q的输出视为具有更高维度的有效伊辛模型的样本,将其映射为经典玻尔兹曼分布。
实验结果
研究问题
- RQ1当前一代的量子退火机能否有效用于从量子玻尔兹曼机中采样以支持强化学习?
- RQ2从量子测量中导出的自由能近似是否在强化学习的早期阶段优于经典采样方法?
- RQ3D-Wave 20000Q的测量在多大程度上近似于经典伊辛模型的玻尔兹曼分布?
- RQ4在网格世界导航任务中,使用量子退火的FERL性能与使用RBM的古典FERL和DQN相比如何?
- RQ5神经网络架构的选择(例如DBM与Chimera图)是否显著影响量子增强型FERL的性能?
主要发现
- 使用D-Wave 20000Q的FERL在早期学习阶段优于使用RBM的古典FERL和DQN,实现了更快的最优策略收敛速度。
- 基于SQA的FERL在Chimera图上的性能与使用实际D-Wave 20000Q样本的FERL非常接近,验证了量子设备作为采样预言机的保真度。
- 基于SQA的FERL使用DBM在Chimera图上略优于D-Wave 20000Q和SQA,表明网络连通性和架构对性能有显著影响。
- 复制堆叠的使用成功地将量子测量映射为有效经典构型,使量子退火机可被视为QBM采样设备。
- 虚拟参数Γ = 0.5和β = 2.0对应于最优退火时序,其中Γ = 0.5与退火时间的2/3点一致,与先前的理论工作相符。
- D-Wave 20000Q的量子样本被证明是经典玻尔兹曼分布样本的有效近似,尤其在所用问题规模和模型架构下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。