[论文解读] Dynamic Sparse Graph for Efficient Deep Learning
本文提出动态稀疏图(DSG),一种新颖的训练与推理框架,通过维度压缩搜索与双掩码选择机制,动态激活仅具有高选择性的神经元,从而实现显著的内存与计算节省。DSG在多个基准测试中,将内存使用量减少1.7–4.5倍,计算操作减少2.3–4.4倍,且精度损失极小,同时保持批量归一化兼容性,并支持在边缘设备上的高效部署。
We propose to execute deep neural networks (DNNs) with dynamic and sparse graph (DSG) structure for compressive memory and accelerative execution during both training and inference. The great success of DNNs motivates the pursuing of lightweight models for the deployment onto embedded devices. However, most of the previous studies optimize for inference while neglect training or even complicate it. Training is far more intractable, since (i) the neurons dominate the memory cost rather than the weights in inference; (ii) the dynamic activation makes previous sparse acceleration via one-off optimization on fixed weight invalid; (iii) batch normalization (BN) is critical for maintaining accuracy while its activation reorganization damages the sparsity. To address these issues, DSG activates only a small amount of neurons with high selectivity at each iteration via a dimension-reduction search (DRS) and obtains the BN compatibility via a double-mask selection (DMS). Experiments show significant memory saving (1.7-4.5x) and operation reduction (2.3-4.4x) with little accuracy loss on various benchmarks.
研究动机与目标
- 解决深度神经网络(DNN)训练中的内存与计算瓶颈问题,其中激活值而非权重主导内存使用。
- 克服现有稀疏化方法的局限性——这些方法虽针对推理优化,但因动态激活与批量归一化(BN)不兼容,导致训练复杂化。
- 通过统一的、与批量归一化兼容的稀疏化机制,实现训练与推理的双重加速,同时保持模型精度。
- 通过在每次训练迭代中仅激活最具选择性的神经元,减少表征冗余。
- 通过最小化训练与推理阶段的内存占用与计算成本,支持在资源受限的边缘设备上部署。
提出的方法
- DSG采用维度压缩搜索,识别并仅激活每次训练迭代中最具选择性的神经元,从而降低激活内存占用与计算量。
- 双掩码选择机制通过在小批量中保持激活统计特性,成功实现批量归一化(BN)兼容性,即使在稀疏设置下亦可维持。
- 该方法在每次迭代中动态重构计算图,确保前向与反向传播过程中稀疏性得以保持。
- 稀疏化应用于神经元层级,而非权重层级,旨在减少激活冗余,而非权重剪枝。
- 该框架支持单节点与分布式训练,且可通过分块与数据重用优化实现硬件加速。
- 训练完成后,可复用相同的稀疏模式用于推理,实现部署各阶段的一致性效率。
实验结果
研究问题
- RQ1如何在不损害模型精度的前提下,有效降低深度神经网络(DNN)训练中的内存与计算成本?
- RQ2为何现有针对推理优化的稀疏化技术无法加速训练?其关键瓶颈是什么?
- RQ3在稀疏训练设置中,如何在激活重新组织破坏稀疏性的前提下,保持批量归一化(BN)的兼容性?
- RQ4动态、神经元层级的稀疏性是否可在反向传播过程中高效计算与维持?
- RQ5动态稀疏性在多种深度神经网络(DNN)架构中,能在多大程度上降低内存与计算成本?
主要发现
- DSG在DNN训练阶段实现最高达4.5倍的内存减少,在推理阶段实现1.7倍的内存减少,显著降低了表征成本。
- 该方法在推理阶段最多减少4.4倍计算操作,在训练阶段减少2.3倍计算操作,且在多个基准测试中精度损失极小。
- 双掩码选择机制成功保持了批量归一化兼容性,尽管存在稀疏性,仍能维持模型精度。
- 在VGG8、ResNet8与AlexNet上的实验表明,DSG在训练时间与精度方面均优于参数量相当的密集模型。
- 动态稀疏机制支持高效的前向与反向传播,适用于云环境与边缘设备的部署。
- 该方法与现有训练流水线兼容,可扩展至分布式训练场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。