[论文解读] Quantum Architecture Search via Continual Reinforcement Learning
该论文提出了一种持续强化学习框架——基于深度Q-learning的概率策略重用(PPR-DQL),以在不同噪声条件下自动化量子线路架构搜索。通过重用先前学习到的策略并适应新环境,该智能体在生成两比特贝尔态方面相比从零开始训练实现了更快的收敛速度和更优的性能。
Quantum computing has promised significant improvement in solving difficult computational tasks over classical computers. Designing quantum circuits for practical use, however, is not a trivial objective and requires expert-level knowledge. To aid this endeavor, this paper proposes a machine learning-based method to construct quantum circuit architectures. Previous works have demonstrated that classical deep reinforcement learning (DRL) algorithms can successfully construct quantum circuit architectures without encoded physics knowledge. However, these DRL-based works are not generalizable to settings with changing device noises, thus requiring considerable amounts of training resources to keep the RL models up-to-date. With this in mind, we incorporated continual learning to enhance the performance of our algorithm. In this paper, we present the Probabilistic Policy Reuse with deep Q-learning (PPR-DQL) framework to tackle this circuit design challenge. By conducting numerical simulations over various noise patterns, we demonstrate that the RL agent with PPR was able to find the quantum gate sequence to generate the two-qubit Bell state faster than the agent that was trained from scratch. The proposed framework is general and can be applied to other quantum gate synthesis or control problems -- including the automatic calibration of quantum devices.
研究动机与目标
- 解决为NISQ设备设计最优量子线路的挑战,此类设计需要专家知识且对噪声敏感。
- 克服先前深度强化学习(DRL)方法在噪声环境变化时缺乏泛化能力的局限性。
- 开发一种可泛化的量子门序列合成框架,可在无需从头训练的情况下适应新的噪声模式。
- 通过持续的策略适应实现实时自主纠错,提升噪声量子系统的鲁棒性。
- 证明将持续学习应用于贝尔态制备之外的其他量子控制与线路设计问题的可行性。
提出的方法
- 引入一种增强有概率策略重用(PPR)的深度Q-learning智能体,在遇到新噪声环境时复用先前学习到的策略。
- 采用混合探索策略,利用概率阈值ψ平衡对过往策略(Li)的利用与对新策略(L0)的探索。
- 使用带有温度参数τ的玻尔兹曼策略选择机制,动态优先选择策略库中表现优异的策略。
- 应用目标网络更新机制,更新率T,以稳定深度Q-learning组件的训练并提升收敛性。
- 维护一个经验回放缓冲区D,存储和采样过渡元组(st, at, rt, st+1),以支持离策略学习。
- 通过追踪累积奖励和选择频率来更新策略库,使智能体能够随时间自适应地优化策略选择。
实验结果
研究问题
- RQ1持续强化学习能否提升量子架构搜索智能体在NISQ设备中不同噪声模式下的泛化能力?
- RQ2与从零开始训练相比,策略重用在量子门序列合成中的训练效率和收敛速度有何影响?
- RQ3单一RL智能体在不发生灾难性遗忘的情况下,能在多大程度上适应新噪声环境?
- RQ4所提出的框架能否泛化至贝尔态生成之外的其他量子控制与校准任务?
- RQ5动态探索策略(如π-探索)对持续学习中量子线路的策略选择与性能有何影响?
主要发现
- PPR-DQL智能体在生成两比特贝尔态方面相比从零开始训练实现了更快的收敛速度,尤其在未见过的噪声模式下表现更优。
- 策略重用显著减少了达到高性能所需的训练回合数,证明了更高的样本效率。
- 该框架在多种多样的噪声环境中均保持了强劲性能,表明其对设备条件变化具有良好的泛化能力。
- 智能体成功利用先前学习到的策略加速了在新环境中的学习过程,证实了持续学习在量子控制中的有效性。
- 概率策略重用机制实现了稳定且自适应的策略选择,降低了持续适应过程中的灾难性遗忘风险。
- 数值仿真结果证实,PPR-DQL框架具有可泛化性,可适用于其他量子门合成与控制问题,包括自主设备校准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。