Skip to main content
QUICK REVIEW

[论文解读] Towards Scaling Difference Target Propagation by Learning Backprop Targets

Maxence Ernoult, Fabrice Normandin|arXiv (Cornell University)|Jan 31, 2022
Advanced Memory and Neural Computing被引用 8
一句话总结

本文提出了一种用于差异目标反向传播(DTP)的新型反馈权重训练方案,通过确保反馈路径与转置前向路径之间的逐层雅可比矩阵匹配,使DTP能够紧密逼近反向传播(BP),同时保持生物学上的合理性。该方法在CIFAR-10上实现了SOTA性能(85.33%准确率),在ImageNet 32×32上达到60.54%的top-5准确率,接近BP性能,且具备可扩展性与生物学合理性。

ABSTRACT

The development of biologically-plausible learning algorithms is important for understanding learning in the brain, but most of them fail to scale-up to real-world tasks, limiting their potential as explanations for learning by real brains. As such, it is important to explore learning algorithms that come with strong theoretical guarantees and can match the performance of backpropagation (BP) on complex tasks. One such algorithm is Difference Target Propagation (DTP), a biologically-plausible learning algorithm whose close relation with Gauss-Newton (GN) optimization has been recently established. However, the conditions under which this connection rigorously holds preclude layer-wise training of the feedback pathway synaptic weights (which is more biologically plausible). Moreover, good alignment between DTP weight updates and loss gradients is only loosely guaranteed and under very specific conditions for the architecture being trained. In this paper, we propose a novel feedback weight training scheme that ensures both that DTP approximates BP and that layer-wise feedback weight training can be restored without sacrificing any theoretical guarantees. Our theory is corroborated by experimental results and we report the best performance ever achieved by DTP on CIFAR-10 and ImageNet 32$ imes$32

研究动机与目标

  • 开发一种可扩展至复杂任务(如CIFAR-10和ImageNet 32×32)的生物学合理学习算法,以解决现有差异目标反向传播(DTP)变体因性能不佳且缺乏可扩展性而失效的问题。
  • 在DTP中恢复逐层反馈路径突触权重的训练,以提高生物学合理性,同时保持理论保证。
  • 通过一种新型反馈权重训练方案,学习逐层反向传播目标,使DTP权重更新能紧密逼近反向传播(BP)更新。
  • 在现实非可逆网络架构下,建立DTP与高斯-牛顿优化之间的理论联系,且无需直接反馈连接。

提出的方法

  • 引入局部差异重建损失(L-DRL),用于训练反馈权重,使反馈算子的雅可比矩阵与前向路径雅可比矩阵的转置相匹配(雅可比矩阵匹配条件,JMC)。
  • 通过独立的优化循环最小化L-DRL来训练反馈权重,确保反馈路径能够逐层学习前向路径的逆映射。
  • 利用学习到的反馈权重通过反馈路径传播目标值,通过激活差异(δⁿ ∝ tⁿ − sⁿ)生成局部误差信号,近似反向传播梯度。
  • 在JMC条件下,确保DTP的前向权重更新规则与BP更新规则高度一致,建立梯度匹配特性(GMP)。
  • 将该方法应用于深度网络架构,如CIFAR-10和ImageNet 32×32上的6层VGG类网络,采用标准训练协议,每批次执行多次反馈更新。
  • 通过消融研究验证方法有效性,比较DTP与BP权重更新方向之间的角度差异,结果表明所提方法显著提升了对齐程度。

实验结果

研究问题

  • RQ1能否使一种生物学合理的学习算法(如DTP)实现可扩展性,从而在CIFAR-10和ImageNet 32×32等复杂视觉任务上达到与反向传播(BP)相当的性能?
  • RQ2能否在不牺牲理论保证或性能的前提下,恢复DTP中逐层反馈权重的训练?
  • RQ3通过反馈权重学习反向传播类目标,是否能带来比现有DTP变体更优的DTP与BP权重更新对齐效果?
  • RQ4能否在不使用直接反馈连接的情况下,以逐层方式强制执行雅可比矩阵匹配条件(JMC),同时保持生物学合理性?

主要发现

  • 所提出的DTP方法在CIFAR-10上达到85.33%的准确率,较此前报告的最佳DTP性能(p-DDTP为72.15%)高出约13%,且与BP基线(86.34%)仅相差约1%。
  • 在ImageNet 32×32上,该方法达到60.54%的top-5准确率,与BP基线(61.25%)仅相差约1%,并首次实现DTP在该基准上接近BP性能的结果。
  • 与s-DDTP和p-DDTP相比,所提方法中DTP与BP权重更新方向之间的夹角显著减小,早期层中差异最大可减少15°,表明梯度对齐更优。
  • 局部差异重建损失(L-DRL)成功训练反馈权重以满足雅可比矩阵匹配条件(JMC),而JMC是理论保证DTP能逼近BP的必要条件。
  • 该方法在多个随机种子下均保持优异性能,标准差极低(如CIFAR-10为0.32),表明学习过程具有一致性与可靠性。
  • 结果表明,通过反馈权重学习反向传播目标,可实现可扩展、生物学合理的训练,即使在更深网络中也能紧密逼近BP性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。