Skip to main content
QUICK REVIEW

[论文解读] Variational Quantum Soft Actor-Critic

Qingfeng Lan|arXiv (Cornell University)|Dec 20, 2021
Quantum Computing Algorithms and Architecture被引用 15
一句话总结

本文提出了一种混合量子-经典强化学习算法,即变分量子软演员-critic算法(QuantumSAC),该算法结合变分量子线路(VQC)与经典神经网络,构成策略网络。在Pendulum-v0环境中,其性能与经典Soft Actor-Critic(SAC)相当,但可学习参数显著减少——仅41个对比经典SAC的1,250个,展示了在参数效率方面的量子优势。

ABSTRACT

Quantum computing has a superior advantage in tackling specific problems, such as integer factorization and Simon's problem. For more general tasks in machine learning, by applying variational quantum circuits, more and more quantum algorithms have been proposed recently, especially in supervised learning and unsupervised learning. However, little work has been done in reinforcement learning, arguably more important and challenging. Previous work in quantum reinforcement learning mainly focuses on discrete control tasks where the action space is discrete. In this work, we develop a quantum reinforcement learning algorithm based on soft actor-critic -- one of the state-of-the-art methods for continuous control. Specifically, we use a hybrid quantum-classical policy network consisting of a variational quantum circuit and a classical artificial neural network. Tested in a standard reinforcement learning benchmark, we show that this quantum version of soft actor-critic is comparable with the original soft actor-critic, using much less adjustable parameters. Furthermore, we analyze the effect of different hyper-parameters and policy network architectures, pointing out the importance of architecture design for quantum reinforcement learning.

研究动机与目标

  • 开发一种适用于连续控制任务的量子强化学习算法,该领域在量子强化学习中仍属研究不足。
  • 将变分量子线路(VQCs)整合进最先进的Soft Actor-Critic(SAC)框架,以实现连续控制。
  • 评估量子增强的策略网络是否能在减少模型参数的同时,匹配经典SAC的性能。
  • 研究VQC架构设计(特别是层数和数据重加载)对学习性能与稳定性的影响。

提出的方法

  • 提出一种混合量子-经典策略网络,其中变分量子线路(VQC)处理状态嵌入,而经典前馈神经网络输出动作。
  • 采用数据重加载VQC架构,即在多个层级中反复将输入状态编码进量子线路,以提升表达能力。
  • 通过将经典策略网络替换为混合量子-经典网络,对Soft Actor-Critic(SAC)算法进行适配,同时保留SAC的最大熵目标。
  • 使用经验回放和目标网络以提升训练稳定性,超参数通过网格搜索进行调优。
  • 采用Adam优化算法,为策略和Q网络分别设置独立的学习率,并使用固定的温度系数α=0.2。
  • 通过最后10次训练episode的平均回报评估性能,结果基于10个随机种子进行平均,并通过指数加权平均进行平滑处理。

实验结果

研究问题

  • RQ1将变分量子线路集成进SAC是否能在连续控制任务中实现与经典SAC相当的性能?
  • RQ2使用量子策略网络是否能在不牺牲样本效率或性能的前提下,减少可学习参数的数量?
  • RQ3VQC的架构设计(特别是普通VQC与数据重加载VQC)如何影响学习性能与稳定性?
  • RQ4增加VQC层数对策略性能与量子强化学习中方差的影响是什么?

主要发现

  • 采用数据重加载VQC(n=2层)的QuantumSAC在50,000步后达到与经典SAC几乎相同的性能,平均回报约为1400。
  • 该量子策略网络仅使用41个可学习参数,相比经典SAC的1,250个参数减少了96.7%。
  • QuantumSAC中普通VQC架构的性能低于经典SAC和数据重加载变体,表明架构设计对量子强化学习至关重要。
  • 两种架构的性能均随VQC层数增加而提升,但数据重加载VQC在超过2层后收益递减,表明2层可能已足够实现最优策略建模。
  • 与普通VQC相比,数据重加载VQC在相同参数数量下表现出更低的回报方差,表明其训练稳定性更高。
  • 结果表明,VQC架构设计(尤其是数据重加载)对性能有显著影响,提示量子神经网络设计或可借鉴经典深度学习的洞见。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。