Skip to main content
QUICK REVIEW

[论文解读] A Stable, Fast, and Fully Automatic Learning Algorithm for Predictive Coding Networks

Tommaso Salvatori, Yuhang Song|arXiv (Cornell University)|Nov 16, 2022
Advanced Data Compression Techniques被引用 8
一句话总结

本文提出增量预测编码(iPC),一种完全自动、稳定且快速的学习算法,用于预测编码网络,其将传统的两步权重更新过程替换为同步的增量更新机制。iPC在图像分类和语言建模基准测试中,相较于标准预测编码和反向传播,实现了更优的收敛性、更强的超参数鲁棒性以及更高的测试准确率,且其理论收敛性基于增量期望最大化(iEM)框架推导得出。

ABSTRACT

Predictive coding networks are neuroscience-inspired models with roots in both Bayesian statistics and neuroscience. Training such models, however, is quite inefficient and unstable. In this work, we show how by simply changing the temporal scheduling of the update rule for the synaptic weights leads to an algorithm that is much more efficient and stable than the original one, and has theoretical guarantees in terms of convergence. The proposed algorithm, that we call incremental predictive coding (iPC) is also more biologically plausible than the original one, as it it fully automatic. In an extensive set of experiments, we show that iPC constantly performs better than the original formulation on a large number of benchmarks for image classification, as well as for the training of both conditional and masked language models, in terms of test accuracy, efficiency, and convergence with respect to a large set of hyperparameters.

研究动机与目标

  • 解决现有预测编码(PC)训练算法存在的不稳定性、低效性及对超参数的敏感性问题。
  • 开发一种生物上合理、完全自动的学习算法,消除在推理与权重更新阶段之间切换所需的外部控制信号。
  • 在计算机视觉与自然语言处理任务中,提升训练效率与超参数设置下收敛的鲁棒性。
  • 基于增量期望最大化(iEM)框架,为所提出的算法提供理论收敛性保证。

提出的方法

  • iPC算法以同步方式增量更新神经活动与突触权重,避免了需要单独控制信号来切换阶段。
  • 通过增量期望最大化(iEM)方法重新表述预测编码更新规则,确保收敛至变分自由能的局部最小值。
  • 该方法利用分层生成模型,并通过在单一统一更新时序中交替更新神经状态与突触权重,最小化变分自由能。
  • 算法采用固定的推理学习率0.5,并执行端到端训练,无需手动调整每批次的推理步数。
  • 采用$τ$-修正(基于费舍尔信息)以提升稳定性和性能,尤其在语言模型训练中表现更优。
  • 该框架与标准深度学习组件兼容,如残差连接、层归一化(在有益时使用),以及AdamW和SGD等优化器。

实验结果

研究问题

  • RQ1能否为预测编码网络设计一种完全自动、生物上合理的学习算法,从而消除对外部控制信号以切换推理与权重更新阶段的需求?
  • RQ2将神经活动与突触权重的更新同步化,是否能实现比标准预测编码更快的收敛速度与更优的训练稳定性?
  • RQ3所提出的增量预测编码(iPC)方法是否能在包括图像分类与语言建模在内的多样化基准上,实现与反向传播相当或更优的性能?
  • RQ4iPC是否在广泛的超参数范围内(尤其是批量大小、学习率与推理步数)保持鲁棒性与收敛性?
  • RQ5在变分推断与自由能最小化背景下,所提出的增量更新机制具有怎样的理论收敛特性?

主要发现

  • 在所有图像分类基准测试中,包括CIFAR-10、CIFAR-100与Tiny ImageNet,iPC的测试准确率均高于标准预测编码(PC),且在所有超参数组合下均保持一致的性能提升。
  • 在ImageNet-1k数据集上,iPC使用ResNet-18模型实现了78.4%的top-1准确率,优于PC,并与反向传播性能相当。
  • 在掩码语言建模任务中,iPC的测试损失为93.45(10次随机种子的平均值),显著低于PC(934.5),并与BP(83.62)相当,且损失方差降低了90%。
  • 在条件语言建模任务中,iPC的测试损失为138.5(平均值),优于PC(206.3),并接近BP(112.7),平均性能提升了35%。
  • 在图像分类任务中,iPC在96组超参数组合中全部收敛,而PC仅在26组中收敛,表明其对超参数选择具有更强的鲁棒性。
  • 在分布外移位(如损坏的CIFAR-10)情况下,iPC的模型校准性显著优于BP,表明其在分布外设置下具备更高的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。