Skip to main content
QUICK REVIEW

[论文解读] Parametrized Quantum Policies for Reinforcement Learning

Sofiène Jerbi, Casper Gyurik|arXiv (Cornell University)|Mar 9, 2021
Quantum Computing Algorithms and Architecture被引用 10
一句话总结

本文提出了一种混合量子-经典强化学习框架,采用参数化量子线路(PQCs)作为策略,展示了在标准OpenAI Gym环境中的有效训练,以及在基于经典难题的离散对数问题任务中实现形式化的量子优势。作者证明,在广泛接受的复杂性理论假设下,PQCs能够解决经典模型(包括最先进的深度神经网络)无法处理的强化学习任务。

ABSTRACT

With the advent of real-world quantum computing, the idea that parametrized quantum computations can be used as hypothesis families in a quantum-classical machine learning system is gaining increasing traction. Such hybrid systems have already shown the potential to tackle real-world tasks in supervised and generative learning, and recent works have established their provable advantages in special artificial tasks. Yet, in the case of reinforcement learning, which is arguably most challenging and where learning boosts would be extremely valuable, no proposal has been successful in solving even standard benchmarking tasks, nor in showing a theoretical learning advantage over classical algorithms. In this work, we achieve both. We propose a hybrid quantum-classical reinforcement learning model using very few qubits, which we show can be effectively trained to solve several standard benchmarking environments. Moreover, we demonstrate, and formally prove, the ability of parametrized quantum circuits to solve certain learning tasks that are intractable to classical models, including current state-of-art deep neural networks,<br> under the widely-believed classical hardness of the discrete logarithm problem.

研究动机与目标

  • 解决标准基准环境中量子强化学习模型尚未取得成功的问题。
  • 证明参数化量子线路(PQCs)能够解决经典模型无法处理的强化学习任务。
  • 在离散对数问题为经典难题的假设下,建立PQCs相对于经典学习者(包括深度神经网络)的形式化学习优势。
  • 设计一种基于PQC策略的量子增强强化学习框架,通过经典策略梯度方法(如REINFORCE)进行训练。
  • 在OpenAI Gym环境中对方法进行数值验证,并基于离散对数问题构建可证明困难的强化学习任务。

提出的方法

  • 作者设计了一种混合量子-经典强化学习智能体,其中策略 πθ(a|s) 以参数化量子线路(PQC)实现,策略参数 θ 通过经典策略梯度算法(如REINFORCE)进行优化。
  • 他们采用可训练可观测量权重和输入缩放参数的数据重加载电路,以增强表达能力,并实现在小型量子硬件上的有效训练。
  • 该方法使用量子处理单元(QPUs)评估PQC及其梯度 ∇θ log πθ,实现量子策略的端到端可微训练。
  • 理论分析构建了基于离散对数问题(DLP)的强化学习环境,将DLP的困难性嵌入奖励结构中,以证明PQC策略与任何高效经典学习者之间的可证明性能差距。
  • 作者推导了优化过程成功率的概率界,表明以高概率(1−δ)下,所学习的策略能以高精度解决基于DLP的任务。
  • 他们形式化证明,在离散对数问题为经典难题的假设下,任何高效经典学习者都无法匹配PQC策略的性能,从而确立了理论上的量子优势。

实验结果

研究问题

  • RQ1参数化量子线路(PQCs)是否能在标准强化学习环境(如OpenAI Gym中的环境)中作为策略被有效训练?
  • RQ2在特定任务中,PQCs在强化学习中是否相对于经典深度神经网络策略展现出可度量的学习优势?
  • RQ3在假设离散对数问题为经典难题的前提下,PQCs是否能够解决经典模型可证明无法处理的强化学习任务?
  • RQ4PQC架构中的哪些设计选择(如数据重加载、可观测量权重)显著影响强化学习中的训练性能与收敛性?
  • RQ5能否通过将问题归约为经典难题(如离散对数问题)来在强化学习中证明形式化的量子优势?

主要发现

  • 所提出的基于PQC的策略在标准OpenAI Gym基准(如CartPole和FrozenLake)上的性能与标准深度神经网络策略相当。
  • 该方法成功在仅包含少量量子比特的环境中训练PQC策略,证明了其在近场量子硬件上的可行性。
  • 作者构建了基于离散对数问题(DLP)的强化学习环境,其中PQCs能以高概率解决任务,而经典模型无法做到。
  • 提供了形式化证明:若离散对数问题为经典难题,则任何高效经典学习者都无法匹配PQC策略的性能,从而确立了可证明的量子优势。
  • 以高概率(1−δ),优化算法返回的策略参数 g^s′ 满足:估计的离散对数值与真实值的偏差在 ε 以内,分类准确率 ≥1−ε。
  • 理论界表明,通过足够的训练样本和线路评估次数,PQC策略可实现任意高的准确率且置信度高,证实了该方法的可扩展性与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。