[论文解读] Automated quantum programming via reinforcement learning for combinatorial optimization
该论文提出了一种强化学习框架,用于在模拟和真实的基于门的量子计算机上自动解决组合优化问题的量子编程。使用近端策略优化(PPO)算法,智能体学习生成简短且高质量的量子线路,其性能优于未经训练的智能体和 p=1 的 QAOA 方法,展示了在不同问题实例之间以及在仿真与真实硬件之间的泛化能力。
We develop a general method for incentive-based programming of hybrid quantum-classical computing systems using reinforcement learning, and apply this to solve combinatorial optimization problems on both simulated and real gate-based quantum computers. Relative to a set of randomly generated problem instances, agents trained through reinforcement learning techniques are capable of producing short quantum programs which generate high quality solutions on both types of quantum resources. We observe generalization to problems outside of the training set, as well as generalization from the simulated quantum resource to the physical quantum resource.
研究动机与目标
- 开发一种适用于混合量子-经典系统的通用强化学习框架,用于自动化量子编程。
- 解决近场量子硬件的编程挑战,该类硬件因噪声和量子比特相干时间有限而难以直观编程且易出错。
- 使智能体能够生成紧凑的量子线路,以产生组合优化问题(COPs)的高质量解。
- 评估训练后智能体在未见问题实例之间以及在仿真与真实量子资源之间的泛化能力。
- 探索强化学习在量子程序合成中的可扩展性和可迁移性,超越标准启发式方法(如 QAOA)的局限。
提出的方法
- 使用 OpenAI Gym 的 API 构建强化学习环境,明确定义量子程序合成的观测空间、动作空间和奖励函数。
- 将动作空间定义为有限个离散的单量子比特门集合(例如,RZ、RY 旋转),以实现对量子线路构建的离散控制。
- 采用问题特定的代价哈密顿量的期望值作为奖励信号,并将其缩放至 [0,1] 区间以实现稳定训练。
- 采用共享的演员-critic 神经网络架构,并结合 PPO 算法以优化量子线路生成的策略。
- 通过迭代方式逐步构建量子程序:依次添加门,于量子资源(模拟器或真实 QPU)上评估,并根据观测到的奖励更新策略。
- 观测信息包括量子态测量结果和问题特定特征(例如,图结构),使智能体能够推理问题上下文。
实验结果
研究问题
- RQ1强化学习能否在模拟和真实量子硬件上有效生成简短且高质量的量子程序,用于解决组合优化问题?
- RQ2训练后的智能体在训练分布之外的问题实例上,其泛化能力达到何种程度?
- RQ3在相同的问题集上,RL 生成的程序性能与标准的 p=1 QAOA 启发式方法相比如何?
- RQ4尽管存在噪声和门保真度差异,智能体的策略是否能从仿真环境泛化到真实量子处理器?
- RQ5随着问题规模增大,该方法的可扩展性如何,特别是在训练时间和线路深度方面?
主要发现
- 训练后的强化学习智能体在模拟和真实量子资源上,持续优于未训练智能体和 p=1 QAOA,生成了高质量解。
- 智能体在未见问题实例上表现出泛化能力,表明其学习到了可迁移的策略,而非仅过拟合于训练数据。
- 从仿真量子资源到真实量子处理器的泛化能力已被观察到,表明对噪声和硬件缺陷具有鲁棒性。
- 对于某些问题,最短的门序列(例如,仅含 X 门)被发现为最优,且策略学会了避免次优旋转,与理论预期一致。
- PPO 算法实现了稳定且高效的训练,无需大量超参数调优,支持该框架在实际部署中的可行性。
- 该框架在扩展至非对角哈密顿量及其他量子编程任务方面具有潜力,尤其可通过调整观测和奖励设计实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。