[论文解读] Population-coding and Dynamic-neurons improved Spiking Actor Network for Reinforcement Learning
本文提出了一种多尺度动态编码脉冲动作器网络(MDC-SAN),通过在网络层面整合群体编码,在神经元层面引入具有二阶膜电位动态特性的动态神经元(DNs),以增强强化学习中的时空状态表征。MDC-SAN在OpenAI Gym的四个连续控制任务中优于其基于深度神经网络的对应模型,通过生物启发的编码机制展现出更优的决策性能。
With the Deep Neural Networks (DNNs) as a powerful function approximator, Deep Reinforcement Learning (DRL) has been excellently demonstrated on robotic control tasks. Compared to DNNs with vanilla artificial neurons, the biologically plausible Spiking Neural Network (SNN) contains a diverse population of spiking neurons, making it naturally powerful on state representation with spatial and temporal information. Based on a hybrid learning framework, where a spike actor-network infers actions from states and a deep critic network evaluates the actor, we propose a Population-coding and Dynamic-neurons improved Spiking Actor Network (PDSAN) for efficient state representation from two different scales: input coding and neuronal coding. For input coding, we apply population coding with dynamically receptive fields to directly encode each input state component. For neuronal coding, we propose different types of dynamic-neurons (containing 1st-order and 2nd-order neuronal dynamics) to describe much more complex neuronal dynamics. Finally, the PDSAN is trained in conjunction with deep critic networks using the Twin Delayed Deep Deterministic policy gradient algorithm (TD3-PDSAN). Extensive experimental results show that our TD3-PDSAN model achieves better performance than state-of-the-art models on four OpenAI gym benchmark tasks. It is an important attempt to improve RL with SNN towards the effective computation satisfying biological plausibility.
研究动机与目标
- 通过模拟大脑的细胞集合机制,实现高效的时空编码,以提升脉冲神经网络(SNNs)在强化学习中的表现。
- 通过在网络和神经元两个尺度引入生物上合理的编码机制,解决传统基于深度神经网络(DNN)的动作器在表征复杂状态空间方面的局限性。
- 开发一种脉冲动作器网络,在相同训练配置下,其决策性能优于深度动作器网络(DANs)。
- 在标准连续控制基准测试中验证多尺度动态编码(群体编码与动态神经元)的有效性。
提出的方法
- 在网络尺度采用群体编码,其中每个输入状态维度通过具有可学习感受野的神经元群体进行编码,以增强表征能力。
- 引入新型动态神经元(DNs),其具有二阶膜电位动态特性,受阈值、复位电位以及一个隐式电阻变量U等关键参数控制。
- 采用时间窗内脉冲计数的平均值作为率编码输出,以实现与TD3等连续控制算法的兼容性。
- 使用双延迟深度确定性策略梯度(TD3)算法,结合深度评论家网络,对MDC-SAN进行训练。
- 在单一任务(如Ant-v3)上学习DN的动态参数,并将其迁移至相似任务(如HalfCheetah-v3、Walker2d-v3、Hopper-v3)以评估泛化能力。
- 对比多种输入编码策略(如泊松分布、确定性、基于群体的编码)的性能,以分离群体编码的贡献。
实验结果
研究问题
- RQ1多尺度动态编码(结合网络尺度的群体编码与神经元尺度的动态神经元编码)是否能提升脉冲动作器网络在连续控制任务中的表现?
- RQ2在基于SNN的强化学习中,使用具有二阶膜电位动态特性的动态神经元是否能带来优于标准LIF神经元的性能?
- RQ3在输入表征能力与下游决策性能方面,群体编码与率编码相比有何差异?
- RQ4在SNN中,于某一任务上学习的动态参数在多大程度上可泛化至其他相似控制任务?
- RQ5所提出的MDC-SAN是否能在相同实验设置下超越其基于深度神经网络的对应模型(DAN)?
主要发现
- MDC-SAN在所有四个OpenAI Gym连续控制任务(Ant-v3、HalfCheetah-v3、Walker2d-v3、Hopper-v3)中显著优于其深度动作器网络(DAN)对应模型。
- 仅使用群体编码(C_pop)的策略在所有输入编码方法中表现最佳,优于率编码和混合编码策略。
- 具有二阶动态特性的动态神经元(DNs)在所有四个任务中均持续优于标准LIF神经元,展现出更优的时间信息处理能力。
- DNs表现出更复杂且自适应的响应模式——在弱刺激下稀疏放电,而在强刺激下呈现强烈且非线性的响应,而LIF神经元则呈现可预测的放电或衰减行为。
- 在Ant-v3上学习的动态参数可有效泛化至其他相似任务,表明DNs在不同环境间具有强大的可迁移性与鲁棒性。
- 群体编码与DNs的结合显著增强了时空状态表征能力,从而实现了更高的累积奖励与更优的策略学习性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。