[论文解读] Q-Learning for Continuous Actions with Cross-Entropy Guided Policies
本文提出交叉熵引导策略(CGP),一种稳定且高效的连续动作Q-learning方法,结合了迭代交叉熵方法(CEM)采样与神经策略网络,后者通过模仿CEM的动作选择进行训练。CGP在训练方差更低、超参数鲁棒性更强的前提下,实现了SOTA性能,且推理速度比CEM快3–6倍,同时保持了较低的推理阶段计算成本。
Off-Policy reinforcement learning (RL) is an important class of methods for many problem domains, such as robotics, where the cost of collecting data is high and on-policy methods are consequently intractable. Standard methods for applying Q-learning to continuous-valued action domains involve iteratively sampling the Q-function to find a good action (e.g. via hill-climbing), or by learning a policy network at the same time as the Q-function (e.g. DDPG). Both approaches make tradeoffs between stability, speed, and accuracy. We propose a novel approach, called Cross-Entropy Guided Policies, or CGP, that draws inspiration from both classes of techniques. CGP aims to combine the stability and performance of iterative sampling policies with the low computational cost of a policy network. Our approach trains the Q-function using iterative sampling with the Cross-Entropy Method (CEM), while training a policy network to imitate CEM's sampling behavior. We demonstrate that our method is more stable to train than state of the art policy network methods, while preserving equivalent inference time compute costs, and achieving competitive total reward on standard benchmarks.
研究动机与目标
- 解决离策略深度强化学习在连续控制任务中的不稳定性和超参数敏感性问题。
- 在保持性能的前提下,降低Q-learning在推理阶段的计算成本,尤其适用于实时机器人应用。
- 探究基于CEM的动作采样是否可作为训练神经策略网络的鲁棒监督信号。
- 开发一种方法,在保持迭代采样稳定性的同时,实现策略网络的推理效率。
- 评估在线与离线策略训练在CEM引导策略学习背景下的有效性。
提出的方法
- CGP使用迭代CEM采样选择动作来训练Q函数,利用该方法对噪声和局部最优的鲁棒性。
- 在Q函数训练过程中,同步训练一个确定性神经网络策略,以模仿CEM生成的动作选择。
- 策略网络通过监督学习在CEM生成的演示数据上进行训练,损失函数旨在最小化动作预测误差。
- 该方法支持在线与离线策略训练:在线更新与Q函数更新同步进行,而离线训练在Q函数收敛后执行。
- 推理仅使用训练好的策略网络,避免迭代采样,实现恒定且低延迟的推理时间。
- 该方法与标准深度Q-learning框架兼容,可与DDPG、TD3或SAC等现有算法结合使用。
实验结果
研究问题
- RQ1基于CEM的动作采样能否作为连续动作Q-learning中训练神经策略网络的稳定且有效的监督信号?
- RQ2将CEM采样与学习策略结合,是否相比端到端策略梯度方法能提升训练稳定性和超参数鲁棒性?
- RQ3学习策略的推理效率与直接在推理阶段使用CEM相比如何?
- RQ4在CGP背景下,在线策略训练是否优于离线策略训练?
- RQ5CGP能否在保持跨随机种子和超参数设置更低方差的前提下,实现与SAC或TD3等SOTA方法相当的性能?
主要发现
- CGP在HalfCheetah-v2和Walker2d-v2等标准连续控制基准测试中,性能与SOTA方法(如SAC和TD3)相当。
- 与DDPG和TD3相比,CGP在不同随机种子和超参数组合下的训练方差显著更低,表明其稳定性更强。
- CGP的推理时间比基于CEM的推理快3–6倍,HalfCheetah-v2上每episode的恒定运行时间为约2.35秒,与CEM迭代次数无关。
- CGP在总回报和推理速度上均优于底层的CEM策略,表明模仿学习同时提升了性能与效率。
- CGP中的在线策略训练相比离线训练略优,表明从非平稳Q函数中学习可提供隐式正则化。
- 与直接优化Q函数相比,CEM策略作为监督信号更有效,因为后者在QGP基线中表现出更高的不稳定性与超参数敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。