[论文解读] Off-Policy Actor-Critic in an Ensemble: Achieving Maximum General Entropy and Effective Environment Exploration in Deep Reinforcement Learning
本文提出了一种新颖的策略迭代理论,将软演员-critic(SAC)扩展至最大化广义熵度量——Tsallis熵与Rényi熵,从而在深度强化学习中实现更有效的探索。该方法引入了TAC与RAC算法,并进一步开发了一种基于集成的演员-critic框架(EAC),结合基于自助采样(bootstrap)的探索机制与基于Q-network的动作选择策略,在六个基准控制任务中实现了最先进的样本效率与性能表现,优于SAC及其他先进算法。
We propose a new policy iteration theory as an important extension of soft policy iteration and Soft Actor-Critic (SAC), one of the most efficient model free algorithms for deep reinforcement learning. Supported by the new theory, arbitrary entropy measures that generalize Shannon entropy, such as Tsallis entropy and Renyi entropy, can be utilized to properly randomize action selection while fulfilling the goal of maximizing expected long-term rewards. Our theory gives birth to two new algorithms, i.e., Tsallis entropy Actor-Critic (TAC) and Renyi entropy Actor-Critic (RAC). Theoretical analysis shows that these algorithms can be more effective than SAC. Moreover, they pave the way for us to develop a new Ensemble Actor-Critic (EAC) algorithm in this paper that features the use of a bootstrap mechanism for deep environment exploration as well as a new value-function based mechanism for high-level action selection. Empirically we show that TAC, RAC and EAC can achieve state-of-the-art performance on a range of benchmark control tasks, outperforming SAC and several cutting-edge learning algorithms in terms of both sample efficiency and effectiveness.
研究动机与目标
- 为解决SAC因最大化Shannon熵而导致的有效环境探索不足的问题,即可能保留低回报动作。
- 将软策略迭代扩展至支持连续动作空间中的任意广义熵度量,如Tsallis熵与Rényi熵。
- 开发一种新型基于集成的演员-critic框架(EAC),通过自助采样机制与高层动作选择策略增强探索能力。
- 通过实证验证,熵正则化算法在样本效率与最终性能上均优于SAC及其他最先进方法。
提出的方法
- 提出一种新的策略迭代理论,将软演员-critic泛化为最大化任意熵度量,包括Tsallis熵与Rényi熵。
- 通过分别基于Tsallis熵与Rényi熵最大化的策略优化目标,提出TAC与RAC算法。
- 引入一个策略集合,其中每个策略均被训练以最大化Tsallis或Rényi熵,从而实现多样化的探索策略。
- 采用来自Osband等人(2016)的自助采样机制,以促进整个策略集合在深层环境中的探索能力。
- 设计一种基于值函数的Q-network,用于高层动作选择,整合来自多个集成策略的推荐。
- 采用离策略学习,重用经验回放缓冲区与目标网络以稳定训练,沿用SAC的框架,但将目标函数推广至广义熵度量。
实验结果
研究问题
- RQ1在连续控制任务中,最大化Tsallis与Rényi等广义熵度量是否能带来比Shannon熵更有效的探索?
- RQ2基于Tsallis与Rényi熵的策略在样本效率与最终性能方面与SAC相比如何?
- RQ3通过不同熵度量训练的策略集合是否能超越单个智能体,实现更优的探索与学习性能?
- RQ4在不同环境中,熵指数(q或η)对TAC与RAC性能的影响如何?
- RQ5所提出的EAC框架结合自助采样探索与基于Q-network的动作选择,是否能实现更优的性能与鲁棒性?
主要发现
- TAC、RAC与EAC在六个基准控制任务中均达到最先进性能,无论在样本效率还是最终性能上,均优于SAC及其他领先算法。
- 基于Tsallis与Rényi熵训练的策略集合的EAC算法表现出一致的性能提升,尤其在Ant与Half Cheetah等复杂环境中更为显著。
- 经过适当调优的熵指数(如q=1.5或η=1.5)优于基线SAC,且最优值具有问题特异性。
- 在Lunar Lander任务中,RAC在η=2.0时表现最佳,表明最优熵指数取决于环境的动力学特性。
- 结合自助采样探索与基于Q-network动作选择的基于集成的EAC框架,显著提升了学习稳定性与样本效率,优于单智能体基线方法。
- 所有提出的算法在超参数设置上均表现出鲁棒性,在每个基准任务的10组随机种子下均保持一致的性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。