[论文解读] Dropout Q-Functions for Doubly Efficient Reinforcement Learning
本文提出DroQ,一种计算效率更高的REDQ变体,采用小规模集成的丢弃Q函数并结合层归一化。尽管结构简单,DroQ在样本效率上与REDQ相当,计算效率超过REDQ两倍,且在样本效率上优于SAC,同时保持与SAC相当的速度。
Randomized ensembled double Q-learning (REDQ) (Chen et al., 2021b) has recently achieved state-of-the-art sample efficiency on continuous-action reinforcement learning benchmarks. This superior sample efficiency is made possible by using a large Q-function ensemble. However, REDQ is much less computationally efficient than non-ensemble counterparts such as Soft Actor-Critic (SAC) (Haarnoja et al., 2018a). To make REDQ more computationally efficient, we propose a method of improving computational efficiency called DroQ, which is a variant of REDQ that uses a small ensemble of dropout Q-functions. Our dropout Q-functions are simple Q-functions equipped with dropout connection and layer normalization. Despite its simplicity of implementation, our experimental results indicate that DroQ is doubly (sample and computationally) efficient. It achieved comparable sample efficiency with REDQ, much better computational efficiency than REDQ, and comparable computational efficiency with that of SAC.
研究动机与目标
- 解决REDQ计算效率低下的问题,尽管其使用大规模Q函数集成以实现高样本效率。
- 在不牺牲样本效率的前提下,提升连续控制强化学习中的计算效率。
- 探究在高UTD比率设置下,丢弃是否可作为集成方法的可行替代方案。
- 研究工程实践(特别是丢弃与层归一化)在高UTD强化学习中降低偏差与提升样本效率的作用。
- 证明仅通过最小的架构改动(即丢弃+归一化),即可实现双重高效的强化学习方法。
提出的方法
- 提出DroQ,一种基于REDQ的变体,采用小规模Q函数集成(M=2),并引入丢弃与层归一化。
- 在Q网络的前向传播过程中应用丢弃,以生成随机集成,替代REDQ中完整的独立网络集成。
- 在Q网络的每个全连接层中引入层归一化,以稳定训练并提升泛化能力。
- 对策略和Q函数更新均采用M=2的在目标最小化机制,与REDQ和SAC保持一致。
- 通过取两个丢弃Q函数的最小值来训练策略,该最小值可作为Q值的正则化估计。
- 通过仅在现有SAC或REDQ代码库中添加丢弃与层归一化层来实现该方法,确保方法的简洁性与可复现性。
实验结果
研究问题
- RQ1小规模丢弃Q函数集成(M=2)能否实现与REDQ大规模集成相当的样本效率?
- RQ2在高UTD比率强化学习中,丢弃与层归一化的结合是否能有效降低偏差并提升样本效率?
- RQ3基于丢弃的Q函数能否在计算效率上匹配SAC,同时在速度上超越REDQ?
- RQ4在高UTD强化学习中,哪些工程实践(如归一化方法、集成规模)对有效使用丢弃至关重要?
- RQ5在高UTD强化学习设置下,丢弃是否可作为完整集成的可行替代方案?
主要发现
- 在MuJoCo基准测试中,DroQ实现了与REDQ相当的样本效率,平均返回值达到或超过REDQ水平。
- 与REDQ相比,DroQ将每次更新的计算时间减少了两倍以上,显著提升了运行速度。
- DroQ在计算效率上与SAC相当,实现相似的每步更新耗时,同时在样本效率上优于SAC。
- 消融实验表明,将丢弃与集成平均(M=2)及层归一化结合,对降低偏差与提升性能至关重要。
- 层归一化显著提升了训练稳定性与性能,在相同设置下优于批量归一化与组归一化。
- 该方法极具实用性:仅需在现有SAC或REDQ实现中添加几行代码,加入丢弃与层归一化层,即可实现DroQ。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。