[论文解读] Direct Feedback Alignment Scales to Modern Deep Learning Tasks and Architectures
该论文表明,直接反馈对齐(DFA)能够成功训练现代深度学习架构——包括神经辐射场、推荐系统、图神经网络和Transformer模型——在无需权重传输的情况下实现接近反向传播的性能。尽管以往在扩展到复杂任务方面存在局限,DFA在突触不对称条件下仍能实现高效、可并行的训练,挑战了权重传输对高性能学习必不可少的信念。
Despite being the workhorse of deep learning, the backpropagation algorithm is no panacea. It enforces sequential layer updates, thus preventing efficient parallelization of the training process. Furthermore, its biological plausibility is being challenged. Alternative schemes have been devised; yet, under the constraint of synaptic asymmetry, none have scaled to modern deep learning tasks and architectures. Here, we challenge this perspective, and study the applicability of Direct Feedback Alignment to neural view synthesis, recommender systems, geometric learning, and natural language processing. In contrast with previous studies limited to computer vision tasks, our findings show that it successfully trains a large range of state-of-the-art deep learning architectures, with performance close to fine-tuned backpropagation. At variance with common beliefs, our work supports that challenging tasks can be tackled in the absence of weight transport.
研究动机与目标
- 探究直接反馈对齐(DFA)是否能够扩展到计算机视觉之外的现代深度学习架构与任务。
- 评估DFA在复杂、最先进的模型(如Transformer、图卷积和神经辐射场)上的表现。
- 挑战当前认为权重传输对深度学习中高精度至关重要这一普遍信念。
- 评估DFA在需要高表示能力与复杂优化景观的应用中的可行性。
- 探索架构改进(如双网络推理)是否能提升DFA的性能。
提出的方法
- DFA使用固定的随机反馈矩阵,将全局损失直接投影到每一层的权重上,从而消除对权重传输的需求。
- 该方法采用共享随机矩阵技巧,降低内存使用,实现对大型网络的扩展。
- 对于每一层,误差信号通过固定随机矩阵对全局损失进行线性投影计算,实现局部、异步的权重更新。
- 该方法被应用于多种架构:全连接网络、图卷积、Transformer和基于NeRF的模型。
- 实验包括在NeRF、推荐系统、几何学习和自然语言处理任务中使用DFA进行训练,并与微调后的反向传播结果进行比较。
- 消融研究包括NeRF-Dual(对粗网络和细网络输出取平均)和更宽网络变体(NeRF-XL),以评估鲁棒性与性能提升。
实验结果
研究问题
- RQ1DFA能否以与反向传播相当的性能训练现代深度学习架构,如Transformer和图神经网络?
- RQ2DFA是否能有效扩展到复杂、高容量的模型,如神经辐射场和大型推荐系统?
- RQ3在性能差距仍存在的架构中(如注意力机制),DFA的局限性是什么?
- RQ4通过双网络推理或增加宽度等架构改进,能否缓解DFA中的性能差距?
- RQ5权重传输在复杂深度学习任务的高性能训练中是否真正必要?
主要发现
- DFA成功训练了神经视图合成、推荐系统、几何学习和自然语言处理中的最先进模型,性能接近微调后的反向传播。
- 在Transformer中,DFA与反向传播之间存在性能差距,表明大型复杂架构的常见训练方法可能需要重新思考。
- NeRF-Dual变体通过平均粗网络和细网络的预测结果,减少了高频噪声并提升了视觉质量,尽管PSNR增益微乎其微(每场景不足0.5 dB)。
- 增加网络宽度(NeRF-XL)在DFA下并未提升PSNR,且训练更加内存密集,需采用多GPU设置。
- 尽管缺乏权重传输,DFA在多种架构中仍取得具有竞争力的结果,挑战了突触对称性是高性能所必需的假设。
- 该方法可在V100上用少于500 GPU小时实现复现,且已提供NeRF和推荐系统任务的完整代码与训练模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。