Skip to main content
QUICK REVIEW

[论文解读] Reinforcement co-Learning of Deep and Spiking Neural Networks for Energy-Efficient Mapless Navigation with Neuromorphic Hardware

Guangzhi Tang, Neelesh Kumar|arXiv (Cornell University)|Mar 2, 2020
Advanced Memory and Neural Computing参考文献 27被引用 13
一句话总结

该论文提出了一种混合强化学习框架——脉冲DDPG(SDDPG),通过联合训练脉冲行为网络(SAN)与深度评论网络,实现节能、无地图的机器人导航。该框架部署于英特尔Loihi神经形态芯片上,在每次推理时的能耗较Jetson TX2上的DDPG降低75倍,同时导航成功率提升1%–4.2%,通过SNN与DNN组件之间的协同学习,展现出卓越的能效比与性能表现。

ABSTRACT

Energy-efficient mapless navigation is crucial for mobile robots as they explore unknown environments with limited on-board resources. Although the recent deep reinforcement learning (DRL) approaches have been successfully applied to navigation, their high energy consumption limits their use in several robotic applications. Here, we propose a neuromorphic approach that combines the energy-efficiency of spiking neural networks with the optimality of DRL and benchmark it in learning control policies for mapless navigation. Our hybrid framework, spiking deep deterministic policy gradient (SDDPG), consists of a spiking actor network (SAN) and a deep critic network, where the two networks were trained jointly using gradient descent. The co-learning enabled synergistic information exchange between the two networks, allowing them to overcome each other's limitations through a shared representation learning. To evaluate our approach, we deployed the trained SAN on Intel's Loihi neuromorphic processor. When validated on simulated and real-world complex environments, our method on Loihi consumed 75 times less energy per inference as compared to DDPG on Jetson TX2, and also exhibited a higher rate of successful navigation to the goal, which ranged from 1% to 4.2% and depended on the forward-propagation timestep size. These results reinforce our ongoing efforts to design brain-inspired algorithms for controlling autonomous robots with neuromorphic hardware.

研究动机与目标

  • 为解决在有限机载资源下,移动机器人导航中深度强化学习(DRL)高能耗的问题。
  • 克服纯脉冲神经网络(SNNs)的局限性,例如在复杂环境中对高精度动作值表示能力差以及易发生灾难性遗忘。
  • 开发一种混合框架,结合SNN的能效优势与DRL在策略优化方面的优势,实现实时、无地图的导航。
  • 通过直接使用梯度下降法训练SNN,实现在神经形态硬件(如英特尔Loihi)上高效部署强化学习策略。
  • 在边缘设备上实现比当前最先进DRL方法更高的导航成功率与显著更低的能耗。

提出的方法

  • 提出一种混合SNN/DNN框架——脉冲DDPG(SDDPG),包含用于动作选择的脉冲行为网络(SAN)与用于动作值评估的深度评论网络。
  • 采用改进的时空反向传播(STBP)算法,实现对脉冲行为网络的端到端梯度训练。
  • 通过梯度下降法联合训练SAN与深度评论网络,实现共享表征学习与相互性能提升。
  • 将训练好的SAN部署于英特尔Loihi神经形态处理器上,利用其事件驱动、异步计算机制实现低功耗推理。
  • 通过将SNN训练为低时间步长(T=5至50)以优化推理能耗,降低延迟与功耗,同时不损失性能。
  • 采用奖励调制学习规则结合经验回放,缓解灾难性遗忘,兼顾生物合理性与DRL的鲁棒性。

实验结果

研究问题

  • RQ1联合训练的混合SNN/DNN框架是否能在无地图机器人控制任务中,同时优于独立的DRL或SNN方法,在能效与导航精度方面表现更优?
  • RQ2通过梯度下降训练的SNN在多大程度上能够实现与深度神经网络相当的高精度动作值表示?
  • RQ3在真实世界导航任务中,神经形态硬件上联合训练的SNN的推理能耗与传统边缘设备上DNN的能耗相比如何?
  • RQ4SNN的时空表征中固有的噪声是否有助于在训练过程中逃离次优局部极小值,从而提升策略优化效果?
  • RQ5与DNN转SNN的方法相比,直接使用STBP训练SNN是否能够实现更低的时间步长推理(T)同时保持性能?

主要发现

  • 部署于英特尔Loihi神经形态处理器上的SDDPG,每次推理能耗较运行在Jetson TX2节能模式(MAXQ)下的DDPG低75倍。
  • SDDPG在导航至目标点的成功率上比DDPG高出1%至4.2%,具体取决于前向传播时间步长(T)的大小。
  • 当T=5时,SDDPG在Loihi上的推理能耗为15.53 mJ,而采用DNN转SNN转换方法实现同等性能需多出4.5倍能耗与5倍时间步长。
  • 该混合协同学习方法使SNN克服了其在高精度动作值表示方面的局限性,实现了优于独立SNN的策略优化效果。
  • SNN的噪声性时空输入表征有助于逃离次优局部极小值,增强了训练的鲁棒性。
  • SDDPG在性能与能效方面均优于当前最先进方法,是首个在机器人导航任务中实现能效与精度双重超越SOTA的节能神经形态方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。