Skip to main content
QUICK REVIEW

[论文解读] A Biologically Plausible Learning Rule for Deep Learning in the Brain

Isabella Pozzi, Sander M. Bohté|arXiv (Cornell University)|Nov 5, 2018
Advanced Memory and Neural Computing参考文献 35被引用 17
一句话总结

该论文提出Q-AGREL,一种生物上合理的强化学习规则,使深度神经网络能够通过试错学习图像分类任务,利用全局奖励预测误差和局部注意力反馈。其性能与反向传播相当,即使在包含100个类别的CIFAR100上,训练轮次也仅需1.5–2.5倍。

ABSTRACT

Researchers have proposed that deep learning, which is providing important progress in a wide range of high complexity tasks, might inspire new insights into learning in the brain. However, the methods used for deep learning by artificial neural networks are biologically unrealistic and would need to be replaced by biologically realistic counterparts. Previous biologically plausible reinforcement learning rules, like AGREL and AuGMEnT, showed promising results but focused on shallow networks with three layers. Will these learning rules also generalize to networks with more layers and can they handle tasks of higher complexity? We demonstrate the learning scheme on classical and hard image-classification benchmarks, namely MNIST, CIFAR10 and CIFAR100, cast as direct reward tasks, both for fully connected, convolutional and locally connected architectures. We show that our learning rule - Q-AGREL - performs comparably to supervised learning via error-backpropagation, with this type of trial-and-error reinforcement learning requiring only 1.5-2.5 times more epochs, even when classifying 100 different classes as in CIFAR100. Our results provide new insights into how deep learning may be implemented in the brain.

研究动机与目标

  • 开发一种生物上合理的学习规则,使大脑能够基于强化学习原理实现深度学习。
  • 解决深层网络中突触如何局部计算误差梯度而不依赖全局反向传播的挑战。
  • 将现有低秩强化学习规则(如AGREL和AuGMEnT)推广至任意深度的深层多层网络。
  • 评估此类规则是否能在标准图像分类基准上实现与监督式误差反向传播相当的性能。
  • 展示该学习规则在高类别数复杂任务(如CIFAR100)中的可扩展性。

提出的方法

  • Q-AGREL结合了全局奖励预测误差(RPE)信号(类似于大脑中的神经调制信号)与来自运动或决策区域的局部注意力反馈信号。
  • 注意力反馈选择性地标记与所选动作相关的突触,仅使这些突触发生可塑性变化。
  • 该学习规则在数学上等价于一种仅更新与所选输出单元相关权重的误差反向传播形式。
  • 该规则在直接奖励设置下运行,即在每次网络推理后立即提供反馈,无需延迟信用分配。
  • 网络使用随机梯度下降配合Q-AGREL规则进行训练,无需数据增强或高级优化器。
  • 该方法在全连接、卷积和局部连接架构上,针对MNIST、CIFAR10和CIFAR100进行了评估。

实验结果

研究问题

  • RQ1能否将一种生物上合理的强化学习规则扩展至任意深度的深层前馈网络?
  • RQ2在图像分类任务中,Q-AGREL的性能与标准误差反向传播相比,在准确率和收敛速度方面如何?
  • RQ3Q-AGREL规则是否能扩展至高复杂度任务(如包含100个类别的CIFAR100),且不会带来过高的训练成本?
  • RQ4全局RPE与局部注意力反馈的结合是否足以在深层网络中实现类似反向传播的有效学习?
  • RQ5该规则是否保持低秩学习动态,与大脑中的生物合理性一致?

主要发现

  • 在MNIST上,Q-AGREL在全连接和卷积网络中均达到了99.17%的测试准确率,与标准误差反向传播性能相当。
  • 在CIFAR10上,Q-AGREL的准确率与反向传播相当或略高,收敛所需轮次为后者的1.5至2倍。
  • 在CIFAR100上,Q-AGREL的最终准确率略低于反向传播,但仅需2至2.5倍的训练轮次,展示了其在高类别任务中的可扩展性。
  • Q-AGREL的学习过程显示奖励概率随轮次稳步上升,与反向传播中的误差减少趋势一致,尽管速度较慢。
  • 该规则与仅更新所选动作相关权重的选择性反向传播形式在理论上和实证上均得到验证。
  • 该方法在无需数据增强或高级优化器的情况下依然有效,表明其核心机制具有鲁棒性与生物合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。