[论文解读] Non-linear motor control by local learning in spiking neural networks
本文提出了一种生物可实现的、局部学习规则——FOLLOW,用于训练脉冲神经网络以学习非线性运动动力学的逆模型。通过采用微分前馈架构,网络能够从手臂状态轨迹中推断出连续时间的运动指令,从而在非线性动力学下实现高精度的闭环控制,误差极小。
Learning weights in a spiking neural network with hidden neurons, using local, stable and online rules, to control non-linear body dynamics is an open problem. Here, we employ a supervised scheme, Feedback-based Online Local Learning Of Weights (FOLLOW), to train a network of heterogeneous spiking neurons with hidden layers, to control a two-link arm so as to reproduce a desired state trajectory. The network first learns an inverse model of the non-linear dynamics, i.e. from state trajectory as input to the network, it learns to infer the continuous-time command that produced the trajectory. Connection weights are adjusted via a local plasticity rule that involves pre-synaptic firing and post-synaptic feedback of the error in the inferred command. We choose a network architecture, termed differential feedforward, that gives the lowest test error from different feedforward and recurrent architectures. The learned inverse model is then used to generate a continuous-time motor command to control the arm, given a desired trajectory.
研究动机与目标
- 解决使用局部、稳定且在线学习规则训练具有隐藏层的脉冲神经网络以学习非线性运动动力学逆模型的挑战。
- 证明基于反馈的局部学习规则FOLLOW能够有效实现脉冲网络中连续时间运动控制的逆模型学习。
- 评估并比较不同网络架构(前馈与循环)在FOLLOW规则下的逆模型学习性能,识别最优配置。
- 利用学习到的逆模型实现对双连杆机械臂的闭环控制,展示其在轨迹跟踪中的鲁棒性与准确性。
- 建立该方法在神经机器人学与脉冲计算中的生物可实现性与硬件可行性。
提出的方法
- 采用FOLLOW(基于反馈的在线局部权重学习)规则训练脉冲神经网络中的可塑性突触权重,利用突触前脉冲与突触后误差反馈。
- 采用包含两条并行输入流(无延迟与有延迟)的微分前馈网络架构,以增强时间处理能力与学习性能。
- 训练网络从双连杆机械臂的状态轨迹中推断连续时间的运动指令,输入层与输出层使用随机固定的编码权重。
- 将推断出的运动指令与实际运动指令之间的误差(带有延迟)反馈,以实现局部权重更新,确保稳定性和收敛性。
- 采用比例反馈(增益 $k' = 3$)实现闭环控制,将学习到的逆模型与线性反馈结合,以提升轨迹跟踪性能。
- 使用具有异质性偏置的漏电积分与发放(LIF)神经元,以模拟皮层样动力学并实现非线性函数逼近。
实验结果
研究问题
- RQ1像FOLLOW这样的局部、在线且稳定的规则是否能够训练脉冲神经网络以学习非线性运动系统的逆动力学?
- RQ2在FOLLOW规则下,哪种网络架构——前馈、循环或微分前馈——在学习逆模型时产生最低的测试误差?
- RQ3学习到的逆模型是否能够实现对双连杆机械臂的精确闭环控制以跟踪期望轨迹?
- RQ4基于FOLLOW的控制器性能与不使用逆模型的标准反馈控制相比如何?
- RQ5FOLLOW学习方案在多大程度上具有生物可实现性,并适合在脉冲计算硬件中实现?
主要发现
- 在所有评估的前馈与循环架构中,微分前馈架构在FOLLOW学习规则下实现了最低的测试误差。
- 网络成功学习到从状态轨迹推断连续时间运动指令的能力,从而实现了对双连杆机械臂的精确控制。
- 在采用比例反馈(增益 $k' = 3$)的闭环控制下,机械臂能够紧密跟踪期望轨迹,与开环性能相比显著降低了误差。
- 逆模型显著减小了初始误差,使线性反馈能够有效校正偏差,展示了学习到的逆控制与反馈控制之间的协同效应。
- FOLLOW规则实现了稳定、在线且突触局部的权重更新,使该方法具备生物可实现性与脉冲计算硬件实现的适用性。
- 若无逆模型,标准线性反馈控制因系统非线性动力学而无法跟踪期望轨迹,凸显了学习模型的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。