Skip to main content
QUICK REVIEW

[论文解读] CrossQ: Batch Normalization in Deep Reinforcement Learning for Greater Sample Efficiency and Simplicity

Aditya Bhatt, Daniel Palenicek|arXiv (Cornell University)|Feb 14, 2019
Reinforcement Learning in Robotics被引用 7
一句话总结

CrossQ 引入了一种轻量级深度强化学习算法,通过用 Batch Normalization 代替目标网络并战略性地应用到评论家网络中,实现了连续控制任务中的最先进样本效率,实现了最低为 1 的更新-数据比(UTD)——训练速度比 REDQ 和 DroQ 快达 4 倍,同时避免了复杂的集成方法。

ABSTRACT

Sample efficiency is a crucial problem in deep reinforcement learning. Recent algorithms, such as REDQ and DroQ, found a way to improve the sample efficiency by increasing the update-to-data (UTD) ratio to 20 gradient update steps on the critic per environment sample. However, this comes at the expense of a greatly increased computational cost. To reduce this computational burden, we introduce CrossQ: A lightweight algorithm for continuous control tasks that makes careful use of Batch Normalization and removes target networks to surpass the current state-of-the-art in sample efficiency while maintaining a low UTD ratio of 1. Notably, CrossQ does not rely on advanced bias-reduction schemes used in current methods. CrossQ's contributions are threefold: (1) it matches or surpasses current state-of-the-art methods in terms of sample efficiency, (2) it substantially reduces the computational cost compared to REDQ and DroQ, (3) it is easy to implement, requiring just a few lines of code on top of SAC.

研究动机与目标

  • 在不依赖高 UTD 比率或复杂集成方法的前提下,提升深度强化学习中的样本效率。
  • 探究在离策略深度强化学习中,Batch Normalization 是否能如以往研究结果相反,稳定训练并提升性能。
  • 通过消除目标网络和评论家集成,降低样本高效强化学习中的计算成本,同时保持或提升性能。
  • 证明简单的网络结构改进——如 Batch Normalization、更宽的评论家网络以及移除目标网络——可超越如 REDQ 和 DroQ 等最先进算法。

提出的方法

  • 从 SAC 中移除目标网络,这些网络传统上用于提升训练稳定性,但会增加计算开销。
  • 以精心设计的方式在评论家网络中应用 Batch Normalization,以稳定训练并减少 Q 值估计偏差。
  • 使用更宽的评论家网络以提升优化和学习性能,基于实证发现更宽的网络更易于训练。
  • 保持极低的 UTD 比率(1),与使用 UTD=20 的 REDQ 和 DroQ 相比,显著降低了梯度计算成本。
  • 采用标准 SAC 组件(如 Adam 优化器、熵系数),但通过修改网络架构和训练动态以提升稳定性和样本效率。
  • 进行消融实验以分离分析 BatchNorm、目标网络移除和网络宽度对整体性能的贡献。

实验结果

研究问题

  • RQ1在离策略深度强化学习中,Batch Normalization 是否能成功应用而不会导致训练不稳定,与以往的负面发现相反?
  • RQ2从 SAC 中移除目标网络是否会降低性能,还是可通过如 Batch Normalization 和更宽网络等架构改进来补偿?
  • RQ3如果其他组件得到适当优化,低 UTD 比率(如 1)是否也能实现最先进样本效率?
  • RQ4Batch Normalization、更宽的评论家网络以及目标网络移除对样本效率和训练速度的相对贡献如何?

主要发现

  • CrossQ 在所有 MuJoCo 环境中均实现了最先进样本效率,其学习速度和最终性能均优于 REDQ 和 DroQ。
  • 尽管仅使用 UTD=1,CrossQ 的性能仍与使用 UTD=20 的 REDQ 和 DroQ 相当或更优,表明高 UTD 并非实现样本效率的必要条件。
  • 由于采用低 UTD 和移除目标网络,CrossQ 的实际训练时间相比 REDQ 和 DroQ 最多减少 4 倍。
  • 在结合 Batch Normalization 的情况下,移除目标网络是可行且有效的,挑战了目标网络对稳定性必不可少的传统认知。
  • Batch Normalization 显著提升了离策略强化学习中的训练稳定性和样本效率,即使在无目标网络的情况下也优于 LayerNorm 和 ReLU-over-max 等其他归一化方法。
  • 归一化 Q 值偏差与性能之间无直接相关性:CrossQ 的偏差高于 REDQ,但学习速度更快,尤其在 Humanoid 等高难度任务中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。