[论文解读] Unentangled quantum reinforcement learning agents in the OpenAI Gym
该论文提出了一种基于变分量子线路(VQC)的强化学习智能体,采用无纠缠门的单量子比特参数化线路,并与经典神经网络结合用于后处理。该方法在CartPole和Acrobot环境中实现了比经典全连接网络更快的收敛速度和更优的样本效率,并首次在真实IBM量子硬件上成功训练了量子强化学习智能体。
Classical reinforcement learning (RL) has generated excellent results in different regions; however, its sample inefficiency remains a critical issue. In this paper, we provide concrete numerical evidence that the sample efficiency (the speed of convergence) of quantum RL could be better than that of classical RL, and for achieving comparable learning performance, quantum RL could use much (at least one order of magnitude) fewer trainable parameters than classical RL. Specifically, we employ the popular benchmarking environments of RL in the OpenAI Gym, and show that our quantum RL agent converges faster than classical fully-connected neural networks (FCNs) in the tasks of CartPole and Acrobot under the same optimization process. We also successfully train the first quantum RL agent that can complete the task of LunarLander in the OpenAI Gym. Our quantum RL agent only requires a single-qubit-based variational quantum circuit without entangling gates, followed by a classical neural network (NN) to post-process the measurement output. Finally, we could accomplish the aforementioned tasks on the real IBM quantum machines. To the best of our knowledge, none of the earlier quantum RL agents could do that.
研究动机与目标
- 解决经典强化学习(RL)在大规模状态-动作空间中的样本低效问题。
- 证明量子强化学习智能体可在显著更少的可训练参数下实现相当或更优的性能。
- 设计一种可扩展的、面向近期的量子强化学习架构,无需纠缠门,且兼容NISQ设备。
- 在LunarLander等挑战性环境中,使用极简量子线路和真实量子硬件成功实现训练。
- 为NISQ时代强化学习中的样本效率提供实证性量子优势证据。
提出的方法
- 采用单量子比特变分量子线路(VQC),以参数化泡利旋转作为量子特征映射,避免使用纠缠门以降低错误率。
- 使用经典前馈神经网络处理量子线路的测量结果,构成混合量子-经典策略网络。
- 在多个OpenAI Gym环境中,采用近端策略优化(PPO)作为量子强化学习智能体的训练算法。
- 在模拟器和真实IBM量子处理器(如ibmq_quito)上实现量子线路,以验证硬件可行性。
- 利用基于梯度的方法优化VQC,借助可微分量子线路和参数移位规则进行梯度计算。
- 采用基于奖励的训练循环,并结合探索策略,以在连续和离散控制任务中平衡利用与探索。
实验结果
研究问题
- RQ1仅使用单量子比特且无纠缠门的极简量子线路,其量子强化学习智能体是否能在样本效率上超越经典强化学习智能体?
- RQ2此类量子智能体是否能成功解决OpenAI Gym环境中具有挑战性的连续控制任务(如LunarLander)?
- RQ3在相同优化设置下,所提出的混合量子-经典架构是否比经典全连接神经网络实现更快的收敛速度?
- RQ4所提出的量子强化学习智能体是否可在真实噪声中等规模量子(NISQ)硬件上成功训练并保持稳定?
- RQ5在量子与经典强化学习中,模型复杂度(可训练参数数量)与学习性能之间的权衡如何?
主要发现
- 在相同的优化流程下,量子强化学习智能体在CartPole和Acrobot环境中均实现了比经典全连接神经网络更快的收敛速度。
- 该量子智能体达到相当性能所需的可训练参数数量比经典模型至少少一个数量级。
- 首次成功在LunarLander环境中训练了量子强化学习智能体,使用的是无纠缠门的单量子比特VQC。
- 该量子智能体已成功部署并运行在真实IBM量子设备上,包括ibmq_quito,证明了硬件可行性。
- 无纠缠门的设计显著降低了线路深度和错误率,使智能体能在NISQ硬件上可靠执行。
- 混合架构(VQC后接经典神经网络)在后处理测量结果和策略优化方面表现出色。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。