[论文解读] Quantum Observables for continuous control of the Quantum Approximate Optimization Algorithm via Reinforcement Learning
该论文提出了一种连续强化学习(RL)框架,通过将QAOA视为马尔可夫决策过程,其中经典智能体利用量子测量结果作为观测,控制连续参数(γ, β),从而优化量子近似优化算法(QAOA)。该方法在电路深度增加(对于N=21,最大至p=25)的情况下实现了稳定训练,并通过复用较短episode中的知识,获得了最优或近似最优的MAXCUT解。
We present a classical control mechanism for Quantum devices using Reinforcement Learning. Our strategy is applied to the Quantum Approximate Optimization Algorithm (QAOA) in order to optimize an objective function that encodes a solution to a hard combinatorial problem. This method provides optimal control of the Quantum device following a reformulation of QAOA as an environment where an autonomous classical agent interacts and performs actions to achieve higher rewards. This formulation allows a hybrid classical-Quantum device to train itself from previous executions using a continuous formulation of deep Q-learning to control the continuous degrees of freedom of QAOA. Our approach makes a selective use of Quantum measurements to complete the observations of the Quantum state available to the agent. We run tests of this approach on MAXCUT instances of size up to N = 21 obtaining optimal results. We show how this formulation can be used to transfer the knowledge from shorter training episodes to reach a regime of longer executions where QAOA delivers higher results.
研究动机与目标
- 解决在NISQ时代约束(如噪声和有限相干时间)下高效优化QAOA参数的挑战。
- 通过实现可扩展的、渐进式的训练,克服全局优化器在高深度QAOA电路中的局限性。
- 利用量子测量结果作为丰富观测,提升强化学习智能体策略学习的性能,超越仅依赖目标函数值的局限。
- 证明将较短训练episode中的知识迁移至更长、更深的QAOA电路的可行性。
- 实现在大电路深度(p > 20)下QAOA的稳定优化,而传统方法在此处已失效。
提出的方法
- 将QAOA重新构建成连续动作的强化学习环境,其中智能体控制QAOA电路的变分参数(γ, β)。
- 采用具有连续动作空间的深度Q-learning算法(如DDPG或基于NAF的算法),学习量子设备的最优控制策略。
- 基于目标函数值(如MAXCUT中的期望切割大小)设计奖励函数,并引入延迟奖励以提升学习稳定性。
- 采用选择性量子测量提取态信息,丰富智能体的观测内容,超越经典目标函数值。
- 实施渐进式训练:复用较短episode(p)的策略作为初始化,用于在更长深度(p′ > p)上进行训练,从而实现在大p值下的稳定收敛。
- 在步骤间保持对过去参数{γ, β}的经典记忆,以支持长时域控制并减少观测频率。
实验结果
研究问题
- RQ1连续强化学习是否能在不依赖全局优化的前提下,有效优化随电路深度(p)增加的QAOA参数?
- RQ2与仅依赖目标函数值相比,使用量子测量结果作为观测是否能显著提升强化学习智能体的性能?
- RQ3能否成功将浅层训练(如p=10)中的知识迁移至深层电路(如p=25)以实现稳定训练?
- RQ4在N=21以内的MAXCUT问题上,基于RL的QAOA优化性能上限是什么?是否能达到最优解?
- RQ5延迟奖励和选择性测量策略如何影响深层QAOA电路中的学习稳定性与收敛性?
主要发现
- 该RL智能体在N=21以内的问题实例中实现了最优或近似最优的MAXCUT结果,其奖励值与全局最优解一致。
- 该方法成功在电路深度高达p=25的条件下训练了智能体,这一深度区间内全局优化器因计算不可行而失效。
- 从p=10渐进训练至p=25的过程中,实现了稳定收敛,且在每次深度跃迁中奖励值逐步提升。
- 利用量子测量数据作为观测显著提升了学习效率,实现了更快的收敛速度和更优的策略泛化能力。
- 智能体的策略在不同深度间表现出泛化能力,证明了从短episode向长episode的知识迁移,减少了在大p值下冷启动的需求。
- 延迟奖励和选择性测量策略有助于提升数值稳定性,尤其在高深度区域表现显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。