Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning with Spiking Q-learning

Ding Chen, Peixi Peng|arXiv (Cornell University)|Jan 21, 2022
Advanced Memory and Neural Computing被引用 15
一句话总结

本文提出深度脉冲Q网络(DSQN),一种受生物学启发的强化学习方法,利用非脉冲中间神经元的最大膜电位表示Q值,实现脉冲神经网络(SNN)在深度强化学习中的端到端训练。DSQN在17款Atari游戏中有14款优于基于人工神经网络(ANN)的DQN,且展现出更优的学习稳定性和对对抗性攻击的鲁棒性。

ABSTRACT

With the help of special neuromorphic hardware, spiking neural networks (SNNs) are expected to realize artificial intelligence (AI) with less energy consumption. It provides a promising energy-efficient way for realistic control tasks by combining SNNs with deep reinforcement learning (RL). There are only a few existing SNN-based RL methods at present. Most of them either lack generalization ability or employ Artificial Neural Networks (ANNs) to estimate value function in training. The former needs to tune numerous hyper-parameters for each scenario, and the latter limits the application of different types of RL algorithm and ignores the large energy consumption in training. To develop a robust spike-based RL method, we draw inspiration from non-spiking interneurons found in insects and propose the deep spiking Q-network (DSQN), using the membrane voltage of non-spiking neurons as the representation of Q-value, which can directly learn robust policies from high-dimensional sensory inputs using end-to-end RL. Experiments conducted on 17 Atari games demonstrate the DSQN is effective and even outperforms the ANN-based deep Q-network (DQN) in most games. Moreover, the experiments show superior learning stability and robustness to adversarial attacks of DSQN.

研究动机与目标

  • 开发一种完全基于脉冲的强化学习方法,避免依赖人工神经网络(ANN)进行价值函数估计。
  • 解决现有SNN强化学习方法的局限性,包括泛化能力差、超参数敏感性高,以及因使用ANN导致的能量效率低下。
  • 通过生物上合理的机制,实现高维控制任务中SNN的端到端训练。
  • 提升深度强化学习环境中对对抗性攻击的鲁棒性,并增强学习稳定性。

提出的方法

  • 提出一种新型SNN架构,其中非脉冲中间神经元通过其膜电位编码Q值,灵感源自昆虫感觉运动通路。
  • 使用整个仿真时间内的最大膜电位作为Q值表示,而非最终电位,以更好地捕捉时间动态。
  • 通过脉冲神经元对环境状态进行脉冲序列编码,随后在非脉冲中间神经元中整合以计算Q值。
  • 使用标准深度Q学习与反向传播进行网络端到端训练,无需任何混合ANN-SNN组件。
  • 采用代理梯度方法训练SNN,实现通过脉冲神经元的反向传播。
  • DSQN采用固定仿真时间步长T=8,与ANN-SNN基线中的T=500相比,显著降低了推理时间。

实验结果

研究问题

  • RQ1SNN能否在不依赖ANN进行价值函数估计的情况下,实现深度强化学习的端到端训练?
  • RQ2将时间跨度上的最大膜电位用作Q值表示,是否能提升学习稳定性和性能?
  • RQ3纯脉冲神经网络基的强化学习智能体能否在高维控制任务(如Atari游戏)中超越标准DQN?
  • RQ4与标准DQN相比,所提出的DSQN方法在对抗性攻击下的表现如何?
  • RQ5基于脉冲的Q学习方法是否在保持生物合理性的同时实现了具有竞争力的性能?

主要发现

  • DSQN在17款Atari游戏中的14款上优于基于ANN的DQN,显著提升包括Video Pinball(441,615.2 vs. 276,040.2)和Road Runner(23,206.7 vs. 2,530.0)在内的游戏表现。
  • DSQN展现出更优的学习稳定性,表现为更平滑的学习曲线和更少的Q值预测过估计。
  • 该方法对FGSM白盒对抗性攻击表现出极强的鲁棒性,Video Pinball的性能衰减率仅为0.01%,Star Gunner为0.16%,表明性能下降极小。
  • 与其它解码策略相比,使用时间步长上的最大膜电位显著提升了性能,该结论在四款游戏中得到验证。
  • DSQN仅需8次仿真时间步长即可取得与ANN-SNN基线(500步)相当的性能,表明其具有极高的推理效率。
  • 该方法通过将非脉冲中间神经元建模为Q值载体,保持了高度的生物合理性,与神经生物学感觉运动通路一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。