Skip to main content
QUICK REVIEW

[论文解读] Low-Precision Reinforcement Learning: Running Soft Actor-Critic in Half Precision

Johan Björck, Xiangyu Chen|arXiv (Cornell University)|Feb 26, 2021
Reinforcement Learning in Robotics参考文献 56被引用 7
一句话总结

本论文表明,通过引入六种数值稳定性技术,Soft Actor-Critic (SAC) 代理可在半精度(bfloat16/fp16)下进行训练而不会导致性能下降。所提出的方法——如在 Adam 中存储二阶矩的平方根,以及重新排序算术运算——可实现更低的内存占用和计算量,同时保持全精度性能,在连续控制环境中与全精度奖励表现一致,且无需超参数调优。

ABSTRACT

Low-precision training has become a popular approach to reduce compute requirements, memory footprint, and energy consumption in supervised learning. In contrast, this promising approach has not yet enjoyed similarly widespread adoption within the reinforcement learning (RL) community, partly because RL agents can be notoriously hard to train even in full precision. In this paper we consider continuous control with the state-of-the-art SAC agent and demonstrate that a naïve adaptation of low-precision methods from supervised learning fails. We propose a set of six modifications, all straightforward to implement, that leaves the underlying agent and its hyperparameters unchanged but improves the numerical stability dramatically. The resulting modified SAC agent has lower memory and compute requirements while matching full-precision rewards, demonstrating that low-precision training can substantially accelerate state-of-the-art RL without parameter tuning.

研究动机与目标

  • 在连续控制任务中,利用最先进的 SAC 算法实现低精度强化学习。
  • 解决直接将监督学习中的低精度技术应用于强化学习时所面临的数值不稳定性问题。
  • 开发一组简单、即插即用的改进方法,以在保持全精度性能的同时减少内存占用和计算量。
  • 证明低精度强化学习无需重新训练或超参数调整即可实现与全精度相当的性能。
  • 提供可复现的代码库与方法论,以加速未来在低精度强化学习领域的研究。

提出的方法

  • 提出在 Adam 优化器中存储二阶矩的平方根,以减少动态范围并提升低精度下的数值稳定性。
  • 重新排序算术运算,以最小化取消误差,提升梯度更新的精度。
  • 采用适用于强化学习的损失缩放和 NaN/Infinity 处理策略,尽管这些方法单独使用效果不足。
  • 在权重和激活值上使用混合精度训练(fp16),但仅在结合所提出的稳定性技术时才有效。
  • 使用 qtorch 模拟多种低精度格式(包括 bfloat16 和 8 位定点格式),以验证方法的鲁棒性。
  • 引入一种改进的训练循环,对关键组件(如目标网络)保持全精度统计量,同时在低精度下进行训练。

实验结果

研究问题

  • RQ1监督学习中标准的低精度训练技术能否直接应用于强化学习中的 SAC?
  • RQ2在 fp16 训练中,SAC 所需的具体修改措施是什么,以实现数值稳定性?
  • RQ3在不进行超参数调优的情况下,低精度 SAC 是否能与全精度性能相匹配?
  • RQ4在采用所提方法的半精度下训练 SAC 时,内存和计算量的节省程度如何?
  • RQ5所提方法在不同超参数设置和环境下的鲁棒性如何?

主要发现

  • 对监督学习中低精度技术(如损失缩放和混合精度)的直接应用,在 SAC 训练中无法实现有竞争力的性能。
  • 所提出的六项改进措施使 fp16 下 SAC 的训练性能在基于状态和基于像素的连续控制环境中均与全精度性能保持一致。
  • 采用所提方法在半精度下训练时,内存使用量减少约 50%,计算时间显著加快。
  • 该方法在随机超参数设置下表现稳健,表明其稳定性不仅限于调优后的配置。
  • 消融实验证实,每一项所提技术均对数值稳定性有贡献,其中存储二阶矩的平方根尤为关键。
  • 代码与实现已公开发布,以支持可复现性及未来在低精度强化学习领域的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。