Skip to main content
QUICK REVIEW

[论文解读] Large-Scale Gradient-Free Deep Learning with Recursive Local Representation Alignment

Alexander G. Ororbia, Ankur Mali|arXiv (Cornell University)|Feb 10, 2020
Domain Adaptation and Few-Shot Learning参考文献 59被引用 5
一句话总结

本文提出递归局部表征对齐(rec-LRA),一种无梯度的深度学习算法,通过递归反馈在层间对齐局部表征,实现并行、生物上合理的权重更新。实验表明,rec-LRA在CIFAR-10和ImageNet上的性能与反向传播相当,同时收敛更快,训练显著更迅速,得益于其可并行化特性,证明了其在无需反向传播的情况下可扩展至大规模数据集。

ABSTRACT

Training deep neural networks on large-scale datasets requires significant hardware resources whose costs (even on cloud platforms) put them out of reach of smaller organizations, groups, and individuals. Backpropagation, the workhorse for training these networks, is an inherently sequential process that is difficult to parallelize. Furthermore, it requires researchers to continually develop various tricks, such as specialized weight initializations and activation functions, in order to ensure a stable parameter optimization. Our goal is to seek an effective, neuro-biologically-plausible alternative to backprop that can be used to train deep networks. In this paper, we propose a gradient-free learning procedure, recursive local representation alignment, for training large-scale neural architectures. Experiments with residual networks on CIFAR-10 and the large benchmark, ImageNet, show that our algorithm generalizes as well as backprop while converging sooner due to weight updates that are parallelizable and computationally less demanding. This is empirical evidence that a backprop-free algorithm can scale up to larger datasets.

研究动机与目标

  • 开发一种生物上合理、无梯度的反向传播替代方法,避免对称反向路径的需求。
  • 通过利用层间局部表征对齐,实现在深度网络中高效、可并行化的权重更新。
  • 证明无反向传播算法可扩展至ImageNet等大规模基准测试,具备竞争力的泛化能力。
  • 通过采用更稳定、局部的学习规则,减少对启发式技术(如特殊权重初始化和非线性激活调优)的依赖。
  • 探索用固定噪声图(pconv)替代卷积操作的可行性,以进一步加速训练而不损失性能。

提出的方法

  • 该算法使用递归反馈对齐相邻层之间的局部表征,实现在无反向传播情况下的信用分配。
  • 其采用递归反馈机制,通过一系列局部对齐步骤传播误差信号,基于表征相似性更新权重。
  • 权重更新使用一种局部Hebbian-like规则,将隐藏层表征与输出层派生的目标表征对齐。
  • 该方法用固定随机矩阵近似梯度,替代标准反向传播,降低计算和内存开销。
  • 引入伪卷积(pconv),使用固定噪声图替代可学习滤波器,加速训练同时保持性能。
  • 该算法支持非可微激活函数,且由于其局部、非顺序的更新机制,对梯度消失/爆炸问题具有鲁棒性。

实验结果

研究问题

  • RQ1无梯度学习算法是否能在ImageNet等大规模数据集上实现与反向传播相当的泛化性能?
  • RQ2递归、局部表征对齐机制是否相比反向传播能实现更快收敛和更短训练时间?
  • RQ3该算法是否能在无需反向传播或复杂超参数调优的情况下,有效扩展至深层架构?
  • RQ4使用固定噪声图(pconv)替代可学习卷积对模型性能和训练速度有何影响?
  • RQ5该算法在使用非可微激活函数时,其稳定性和有效性在多大程度上得以保持?

主要发现

  • 在ImageNet上,rec-LRA实现了30.48%的top-1错误率和11.97%的top-5错误率,接近反向传播基线的28.15%和9.81%。
  • 在8张V100 GPU上,rec-LRA训练耗时3小时12分钟,而反向传播为3小时45分钟,每轮训练提速2.127分钟。
  • 在CIFAR-10上,rec-LRA优于其他无梯度方法(如反馈对齐和目标传播),接近反向传播性能。
  • 该算法收敛比反向传播训练的ResNets更平稳,且在MNIST和FMNIST上收敛更快。
  • 使用64个固定噪声掩码的pconv替代标准卷积,性能下降可忽略,但每小批量训练提速0.73秒。
  • rec-LRA对非可微激活函数表现出鲁棒性,并消除了对特殊权重初始化或激活工程的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。