[论文解读] Kernelized information bottleneck leads to biologically plausible 3-factor Hebbian learning in deep networks
该论文提出了一种基于核化信息瓶颈框架推导出的生物可解释的三因素赫布学习规则,适用于深度网络。通过使用可合理计算的目标(pHSIC)近似希尔伯特-施密特独立性准则,该方法实现了仅依赖突触前与突触后活动及全局误差信号的局部、逐层权重更新,从而无需反向传播、权重传输或精确标签。该方法在MNIST、fashion-MNIST、Kuzushiji-MNIST和CIFAR10数据集上实现了接近反向传播的性能表现,尤其在结合除法归一化时表现更优。
The state-of-the art machine learning approach to training deep neural networks, backpropagation, is implausible for real neural networks: neurons need to know their outgoing weights; training alternates between a bottom-up forward pass (computation) and a top-down backward pass (learning); and the algorithm often needs precise labels of many data points. Biologically plausible approximations to backpropagation, such as feedback alignment, solve the weight transport problem, but not the other two. Thus, fully biologically plausible learning rules have so far remained elusive. Here we present a family of learning rules that does not suffer from any of these problems. It is motivated by the information bottleneck principle (extended with kernel methods), in which networks learn to compress the input as much as possible without sacrificing prediction of the output. The resulting rules have a 3-factor Hebbian structure: they require pre- and post-synaptic firing rates and an error signal - the third factor - consisting of a global teaching signal and a layer-specific term, both available without a top-down pass. They do not require precise labels; instead, they rely on the similarity between pairs of desired outputs. Moreover, to obtain good performance on hard problems and retain biological plausibility, our rules need divisive normalization - a known feature of biological networks. Finally, simulations show that our rules perform nearly as well as backpropagation on image classification tasks.
研究动机与目标
- 开发一种适用于深度网络的完全生物可解释的学习规则,以规避反向传播的局限性。
- 解决反向传播的三大不现实之处:权重传输问题、前后向传递交替进行、对精确标签的依赖。
- 基于信息瓶颈原理,利用核方法推导出可计算优化的学习规则。
- 确保该规则具备局部性、可扩展性,并与已知的生物神经机制(如除法归一化)兼容。
- 在标准图像分类基准上展示该方法在无需反向传播或标签监督下的竞争力表现。
提出的方法
- 该方法采用改进的核化信息瓶颈目标,用核化协方差替代互信息,以支持局部学习。
- 提出“合理HSIC”(pHSIC),一种近似方法,避免神经元需存储多个数据点的活动信息。
- 所得学习规则具有三因素赫布结构:突触前活动、突触后活动,以及来自输出相似性的逐层特定误差信号。
- 误差信号基于目标输出之间的成对相似性计算,从而无需精确标签。
- 引入除法归一化以在困难任务上稳定训练,并与生物网络动力学保持一致。
- 该方法以逐层方式进行,仅利用相邻层活动与全局教学信号更新权重,避免反向传递。
实验结果
研究问题
- RQ1能否从信息瓶颈原理推导出一种在深度网络中完全生物可解释的学习规则?
- RQ2此类规则能否避免权重传输问题,消除对前后向传递交替进行的需求,并减少对精确标签的依赖?
- RQ3在引入除法归一化后,是否能提升在具有挑战性的图像分类任务上的性能,同时保持生物可解释性?
- RQ4基于pHSIC的所提规则在标准基准上的性能与反向传播及其他生物启发方法相比如何?
- RQ5该方法能否在无需反向传播或标签数据的情况下,泛化至不同数据集和网络架构?
主要发现
- 基于pHSIC的学习规则在MNIST、fashion-MNIST和Kuzushiji-MNIST上的测试准确率与反向传播相差仅1-3%,在使用AdamW和批量归一化的2倍宽网络下,CIFAR10上的准确率达到94.5%。
- 在CIFAR10上,采用余弦相似性核与除法归一化的该方法,2倍宽网络达到90.4%的准确率,优于反馈对齐与符号对称方法。
- 使用除法归一化显著提升了训练的稳定性和性能,尤其在SGD训练中,减少了不同随机种子之间的方差。
- 该方法无需精确标签,仅依赖目标输出之间的成对相似性,即可实现高性能。
- pHSIC目标保持为原始HSIC目标的有效上界,确保理论一致性,同时支持生物可解释的计算。
- 训练动态显示,pHSIC有效压缩了输入信息,同时保留了对输出的预测能力,pHSIC与HSIC项的收敛性可作为证据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。