[论文解读] An FPGA-Based On-Device Reinforcement Learning Approach using Online Sequential Learning
该论文提出了一种基于FPGA加速的设备端强化学习框架,采用OS-ELM实现轻量化、实时推理,适用于资源受限的边缘设备。通过用解析权重更新替代反向传播,并结合L2正则化与谱归一化,该方法在CartPole-v0环境上使用64个隐藏单元时,训练速度比DQN快89.40倍,实现了在PYNQ-Z1 FPGA平台上的稳定、低延迟部署。
DQN (Deep Q-Network) is a method to perform Q-learning for reinforcement learning using deep neural networks. DQNs require a large buffer and batch processing for an experience replay and rely on a backpropagation based iterative optimization, making them difficult to be implemented on resource-limited edge devices. In this paper, we propose a lightweight on-device reinforcement learning approach for low-cost FPGA devices. It exploits a recently proposed neural-network based on-device learning approach that does not rely on the backpropagation method but uses OS-ELM (Online Sequential Extreme Learning Machine) based training algorithm. In addition, we propose a combination of L2 regularization and spectral normalization for the on-device reinforcement learning so that output values of the neural network can be fit into a certain range and the reinforcement learning becomes stable. The proposed reinforcement learning approach is designed for PYNQ-Z1 board as a low-cost FPGA platform. The evaluation results using OpenAI Gym demonstrate that the proposed algorithm and its FPGA implementation complete a CartPole-v0 task 29.77x and 89.40x faster than a conventional DQN-based approach when the number of hidden-layer nodes is 64.
研究动机与目标
- 在低成本、资源受限的FPGA平台(如PYNQ-Z1)上实现设备端实时强化学习。
- 克服因反向传播与经验回放开销导致DQN在边缘设备上计算不可行的问题。
- 通过正则化技术稳定单隐藏层OS-ELM网络中的Q值输出。
- 通过将强化学习流水线中的顺序操作卸载至FPGA,加速推理与训练。
提出的方法
- 所提方法用OS-ELM替代DQN的反向传播,一次性解析计算输出权重,消除迭代优化过程。
- 采用简化的Q网络架构,仅含一个隐藏层且输入权重固定,降低计算复杂度。
- 联合应用输出权重的L2正则化与输入权重的谱归一化,以约束Lipschitz常数并稳定Q值预测。
- 在PYNQ-Z1上通过混合CPU-FPGA架构实现OS-ELM Q-Network,其中FPGA加速predict_seq与train_seq中的矩阵运算。
- 系统使用AXI总线与DMA实现CPU-FPGA数据传输,假设float32数据传输延迟为1周期。
- 训练与推理任务卸载至FPGA以提升性能,而初始化与控制逻辑则在CPU上运行。
实验结果
研究问题
- RQ1基于OS-ELM的设备端学习是否能在无反向传播的情况下,实现在低成本FPGA上的稳定且快速的强化学习?
- RQ2L2正则化与谱归一化联合使用在稳定单层OS-ELM网络中Q值输出方面的有效性如何?
- RQ3与传统DQN相比,FPGA加速在提升设备端强化学习的推理与训练速度方面能带来多大程度的性能增益?
- RQ4在隐藏层规模增加时,系统在性能与稳定性方面表现如何?
主要发现
- 在CartPole-v0环境中使用64个隐藏单元时,所提OS-ELM-L2-Lipschitz方法的训练速度比DQN快29.77倍。
- FPGA加速实现版本在完成CartPole-v0任务时,相比DQN实现了89.40倍的速度提升。
- 由于联合正则化的作用,该方法在不同隐藏层规模下均保持稳定有效,防止了Q值发散。
- OS-ELM方法中的主要性能瓶颈是train_seq操作,其时间复杂度与矩阵规模∼ℝ^(N×N)×ℝ^(N×N)成正比,因此FPGA加速具有显著优势。
- OS-ELM-L2-Lipschitz与FPGA版本的执行时间随隐藏层规模增加而上升,但依然显著快于DQN,而DQN的性能提升则不明显。
- FPGA实现将64个隐藏单元的总执行时间减少至24.71秒,相较DQN的2208.90秒,展现出强大的硬件加速优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。