[论文解读] Hardware Beyond Backpropagation: a Photonic Co-Processor for Direct Feedback Alignment
本文提出首个与架构无关的光子协同处理器,用于使用直接反馈对齐(DFA)训练深度神经网络。DFA是一种无需反向传播的训练方法,用单个随机投影替代梯度反向传播。该系统通过光学方式计算数万亿参数的随机投影,实现可扩展、通信高效的训练;其在MNIST和Cora基准测试中的性能与基于GPU的DFA相当,证明了光学硬件在超越传统反向传播的超大规模深度学习中的可行性。
The scaling hypothesis motivates the expansion of models past trillions of parameters as a path towards better performance. Recent significant developments, such as GPT-3, have been driven by this conjecture. However, as models scale-up, training them efficiently with backpropagation becomes difficult. Because model, pipeline, and data parallelism distribute parameters and gradients over compute nodes, communication is challenging to orchestrate: this is a bottleneck to further scaling. In this work, we argue that alternative training methods can mitigate these issues, and can inform the design of extreme-scale training hardware. Indeed, using a synaptically asymmetric method with a parallelizable backward pass, such as Direct Feedback Alignement, communication needs are drastically reduced. We present a photonic accelerator for Direct Feedback Alignment, able to compute random projections with trillions of parameters. We demonstrate our system on benchmark tasks, using both fully-connected and graph convolutional networks. Our hardware is the first architecture-agnostic photonic co-processor for training neural networks. This is a significant step towards building scalable hardware, able to go beyond backpropagation, and opening new avenues for deep learning.
研究动机与目标
- 解决使用传统反向传播方法在扩展深度学习模型至数万亿参数以上时面临的通信瓶颈问题。
- 探索替代性训练方法(如直接反馈对齐,DFA),通过实现并行、突触不对称的权重更新,减少节点间通信。
- 设计并展示一种硬件无关的光子协同处理器,能够高效计算DFA所需的大型随机投影。
- 通过在标准基准测试中复现GPU级别的性能,验证光学硬件用于训练深度网络的可行性。
- 通过结合超越反向传播的算法与光子加速,为超大规模深度学习开辟新路径。
提出的方法
- 该系统实现直接反馈对齐(DFA),用将最终误差信号单个随机投影至所有层的方式,替代梯度反向传播。
- 光子协同处理器利用硅光子技术执行光学随机投影,实现数万亿参数的并行处理。
- 该协同处理器具有架构无关性,可适用于任意神经网络结构,包括全连接网络和图卷积网络。
- 对随机投影权重应用三值化,以降低位深并提升硬件效率,且性能损失极小。
- 系统使用单个大型随机投影,通过切片生成各层的反馈信号,从而在反向传播中消除层间通信。
- 通过将结果与基于GPU的DFA在MNIST(全连接)和Cora(图卷积)任务上的表现进行对比,验证了光学实现的正确性。
实验结果
研究问题
- RQ1光子协同处理器能否高效计算DFA训练所需的大型随机投影?
- RQ2光学实现的DFA在标准基准任务上的性能是否可与基于GPU的DFA相媲美?
- RQ3光子协同处理器能否同时支持全连接网络和图神经网络架构,体现硬件无关性?
- RQ4权重量化(如三值化)对光学DFA训练性能有何影响?
- RQ5在当前光学带宽和调制限制下,光学硬件能否扩展至满足现代大模型(如GPT-3)所需的参数规模?
主要发现
- 光子协同处理器成功通过光学方式计算了大型随机投影,实现了在MNIST和Cora基准测试中使用DFA的训练。
- 光学DFA实现的性能与基于GPU的DFA相当,仅存在因极少数超参数调优和模拟系统噪声导致的微小差距。
- 对随机投影权重进行三值化在测试任务中未造成性能损失,模型准确率得以保持。
- t-SNE可视化结果表明,光子DFA系统学习到的中间表征与反向传播学习到的表征具有同等语义意义。
- 该系统可扩展至最多100万个输入和200万个输出,展示了超越当前电子硬件极限的超大规模深度学习潜力。
- 该协同处理器通过将完整梯度交换替换为单个误差信号,实现了计算节点间的无通信训练,显著降低了节点间通信开销。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。