[论文解读] Extension of Direct Feedback Alignment to Convolutional and Recurrent Neural Network for Bio-plausible Deep Learning
该论文提出了一种混合直接反馈对齐(HDFA)方法,通过模块化网络结构,将生物上合理的训练方法扩展至卷积神经网络(CNNs)和循环神经网络(RNNs)。该方法在CNN中采用空洞卷积和分组卷积,在RNN中采用稀疏反向权重,并结合BP与DFA以实现BP级别的精度。该方法在极低硬件成本下实现了最先进性能,消除了并行训练中的反向传播锁定问题。
Throughout this paper, we focus on the improvement of the direct feedback alignment (DFA) algorithm and extend the usage of the DFA to convolutional and recurrent neural networks (CNNs and RNNs). Even though the DFA algorithm is biologically plausible and has a potential of high-speed training, it has not been considered as the substitute for back-propagation (BP) due to the low accuracy in the CNN and RNN training. In this work, we propose a new DFA algorithm for BP-level accurate CNN and RNN training. Firstly, we divide the network into several modules and apply the DFA algorithm within the module. Second, the DFA with the sparse backward weight is applied. It comes with a form of dilated convolution in the CNN case, and in a form of sparse matrix multiplication in the RNN case. Additionally, the error propagation method of CNN becomes simpler through the group convolution. Finally, hybrid DFA increases the accuracy of the CNN and RNN training to the BP-level while taking advantage of the parallelism and hardware efficiency of the DFA algorithm.
研究动机与目标
- 为解决直接反馈对齐(DFA)在训练卷积神经网络(CNNs)和循环神经网络(RNNs)时准确率较低的问题,该问题限制了其作为BP替代方案的采用。
- 通过采用生物上合理的误差传播方法,解决反向传播(BP)中的反向锁定问题,实现并行误差传播。
- 在降低内存事务和计算成本的同时,实现与反向传播(BP)相当的训练准确率。
- 开发一种混合训练框架(HDFA),融合DFA与BP的优势,以实现最佳性能和硬件效率。
提出的方法
- 将CNN和RNN划分为更小的模块化组件,以实现在每个模块内局部化的直接误差传播。
- 在CNN中应用空洞卷积以减少参数依赖性并改善梯度流动。
- 使用分组卷积以简化误差传播并打破CNN中的通道级数据依赖性。
- 在RNN中实现稀疏反向权重矩阵,特别是采用上三角结构,以降低复杂度和计算量。
- 引入二值化与稀疏DFA优化技术,以减少内存事务和计算负载。
- 提出一种混合训练算法(HDFA):在关键层使用BP,在其他层使用DFA,以在较低硬件成本下实现BP级别的精度。
实验结果
研究问题
- RQ1直接反馈对齐(DFA)能否被有效扩展至训练卷积神经网络(CNNs)和循环神经网络(RNNs),并实现与反向传播(BP)相当的准确率?
- RQ2如何通过生物上合理的误差传播方法解决BP中的反向锁定问题?
- RQ3哪些架构改进(如空洞卷积、分组卷积、稀疏权重)能够提升CNN和RNN中DFA的性能?
- RQ4结合BP与DFA的混合训练策略能否在最小化硬件成本和内存事务的同时,实现BP级别的准确率?
- RQ5所提出的HDFA方法在多GPU环境中在多大程度上实现了并行误差传播?
主要发现
- 所提出的HDFA方法在CIFAR-10和CIFAR-100数据集上实现了与反向传播(BP)相当的测试准确率,ResNet-50实验中准确率达到98%。
- 与传统BP相比,HDFA将内存事务减少了高达98%,在RNN训练中仅消耗1.1 GOP(十亿次操作),且稀疏度达到98%。
- 由于消除了反向锁定并实现了完全并行化,HDFA在RNN训练中的误差传播速度比BP快达35倍。
- CNN中使用空洞卷积和分组卷积可降低误差传播复杂度并提升训练稳定性。
- RNN中采用稀疏反向权重,特别是使用上三角矩阵,可显著降低计算与内存使用,同时保持高准确率。
- 在所有测试方法中,包括传统DFA、改进DFA和BP,HDFA实现了最低的硬件成本,同时达到与BP相当的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。