[论文解读] FIXAR: A Fixed-Point Deep Reinforcement Learning Platform with Quantization-Aware Training and Adaptive Parallelism
FIXAR 是一个固定点深度强化学习平台,通过量化感知训练和自适应FPGA加速,实现了每秒25,293.3次推理(IPS)的吞吐量和每瓦2,638.0 IPS/W的能量效率——比CPU-GPU平台快2.7倍,能效高15.4倍,同时在连续控制任务中使用DDPG算法,采用半精度固定点算术保持了完整的训练精度。
In this paper, we present a deep reinforcement learning platform named FIXAR which employs fixed-point data types and arithmetic units for the first time using a SW/HW co-design approach. Starting from 32-bit fixed-point data, Quantization-Aware Training (QAT) reduces its data precision based on the range of activations and performs retraining to minimize the reward degradation. FIXAR proposes the adaptive array processing core composed of configurable processing elements to support both intra-layer parallelism and intra-batch parallelism for high-throughput inference and training. Finally, FIXAR was implemented on Xilinx U50 and achieves 25293.3 inferences per second (IPS) training throughput and 2638.0 IPS/W accelerator efficiency, which is 2.7 times faster and 15.4 times more energy efficient than those of the CPU-GPU platform without any accuracy degradation.
研究动机与目标
- 解决深度强化学习(DRL)训练的高计算成本问题,传统上依赖昂贵的单精度浮点数运算。
- 克服在DRL中应用数据量化带来的挑战,因为精度损失可能严重损害复杂环境中长期策略学习的效果。
- 设计一种软硬件协同平台,支持使用双精度固定点(32位和16位)进行训练和推理,且不损失精度。
- 通过利用基于FPGA的自适应数据流和并行化技术,实现DNN运算中DRL工作负载的高吞吐量和高能效。
- 与现有CPU-GPU和基于FPGA的DRL加速器相比,特别是在复杂连续控制任务中,展示出更优越的性能和效率。
提出的方法
- 提出一种量化感知训练算法,可在预设训练步数后动态将固定点精度从32位降低至16位,同时保持模型精度。
- 设计一种基于FPGA的加速器,配备可配置数据通路和双精度固定点算术的自适应阵列处理(AAP)核心,支持前向传播和反向传播。
- 在AAP核心中实现层内和批内并行化,以在不同批大小下最大化硬件利用率和吞吐量。
- 集成片上内存结构,以最小化对外部存储器的访问,降低训练过程中的延迟和能耗。
- 采用CPU-FPGA协同设计架构,其中CPU模拟MuJoCo环境,FPGA加速所有DNN推理和训练操作。
- 通过用低精度固定点算术单元替代浮点数单元,优化加速器以提升能效,降低功耗同时提高吞吐量。
实验结果
研究问题
- RQ1在不损害策略精度的前提下,是否可以安全地将具有动态精度降低的固定点算术应用于深度强化学习训练?
- RQ2如何设计基于FPGA的加速器,以高效支持DRL中双精度固定点的训练和推理?
- RQ3通过结合量化感知训练与自适应数据流及并行化技术,在DRL工作负载中可实现怎样的性能和能效水平?
- RQ4在连续控制任务中,FIXAR平台与CPU-GPU平台及现有基于FPGA的DRL加速器相比,在吞吐量和能效方面表现如何?
- RQ5自适应并行化和片上内存优化在多大程度上提升了硬件利用率并减少了DRL训练中的系统级瓶颈?
主要发现
- FIXAR实现了每秒25,293.3次推理(IPS)的系统级训练吞吐量,是CPU-GPU平台的2.7倍。
- FPGA加速器本身实现了53,826.8 IPS的吞吐量,在相同工作负载下显著超过GPU的9,786.7 IPS。
- FIXAR加速器实现了2,638.0 IPS/W的能效,是Titan RTX GPU的171.3 IPS/W的15.4倍。
- 由于自适应阵列处理核心中有效的层内和批内并行化,所有批大小下的硬件利用率均保持在92.4%的高水平。
- 尽管在训练步数达到一定阈值后将数据精度从32位降低至16位固定点,平台仍保持了完整的训练精度,验证了量化感知训练方法的有效性。
- 在最先进的基于FPGA的DRL加速器中,FIXAR即使在针对连续动作空间中最复杂的DNN模型时,也表现出最佳的性能和能效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。