Skip to main content
QUICK REVIEW

[论文解读] Differentiable Sparsification for Deep Neural Networks

Yognjin Lee|arXiv (Cornell University)|Oct 8, 2019
Advanced Neural Network Applications参考文献 39被引用 5
一句话总结

该论文提出了一种用于深度神经网络的完全可微稀疏化方法,通过使用随机梯度下降的正则化目标函数,联合优化网络权重与稀疏结构。通过采用可学习的注意力掩码和可微归一化,该方法实现了最小架构改动下的端到端训练,在保持或提升模型性能的同时实现了最先进水平的稀疏性。

ABSTRACT

Deep neural networks have significantly alleviated the burden of feature engineering, but comparable efforts are now required to determine effective architectures for these networks. Furthermore, as network sizes have become excessively large, a substantial amount of resources is invested in reducing their sizes. These challenges can be effectively addressed through the sparsification of over-complete models. In this study, we propose a fully differentiable sparsification method for deep neural networks, which can zero out unimportant parameters by directly optimizing a regularized objective function with stochastic gradient descent. Consequently, the proposed method can learn both the sparsified structure and weights of a network in an end-to-end manner. It can be directly applied to various modern deep neural networks and requires minimal modification to the training process. To the best of our knowledge, this is the first fully differentiable sparsification method.

研究动机与目标

  • 为应对设计高效深度神经网络架构时日益增长的挑战,同时最大限度减少人工干预。
  • 克服传统剪枝和近端梯度方法的局限性,后者需要手动实现或闭式解。
  • 通过完全可微的框架,实现网络权重与稀疏模式的端到端学习。
  • 支持灵活的正则化,包括任意范数,包括非凸的$l_p$-范数,而无需解析的近端算子。
  • 将稀疏化无缝集成到各种深度学习模型中,对训练流水线的修改极小。

提出的方法

  • 引入可学习的注意力掩码$\tilde{A}_{i,j} = \exp(\alpha_{i,j})$,以表示网络组件之间的潜在连接。
  • 应用迭代的、可微的平衡归一化(Sinkhorn归一化的一种变体),将$\tilde{A}$转换为双随机矩阵$A$。
  • 对$A$的行和列向量使用$p=0.5$的$l_p$-范数正则化,以促进组内结构化稀疏性和竞争。
  • 将稀疏化模块整合到损失函数中,表示为$\mathcal{L}(D,W,A) + \frac{\lambda}{2}\sum_{i=1}^{N}\left[\mathcal{R}(A_{i,:}) + \mathcal{R}(A_{:,i})\right]$,其中$\mathcal{R}$为$l_p$-范数。
  • 利用自动微分反向传播通过整个稀疏化过程,消除了对手动近端更新的依赖。
  • 将该方法端到端应用于图神经网络,证明其在学习道路网络中稀疏且有意义的关系方面的有效性。

实验结果

研究问题

  • RQ1能否设计一种完全可微的稀疏化方法,在不依赖预训练模型或闭式近端算子的情况下,联合优化网络权重与稀疏结构?
  • RQ2与传统的$l_1$或$l_{2,1}$正则化相比,使用$l_p$-范数正则化($p=0.5$)的可微稀疏化在诱导结构化稀疏性方面表现如何?
  • RQ3该方法在真实世界图结构数据(如交通网络)中,能在多大程度上学习到有意义且稀疏的结构关系?
  • RQ4该方法能否在各种深度神经网络架构上应用,且对架构的修改极小?
  • RQ5使用可微归一化(如Sinkhorn风格)是否能可靠地生成双随机矩阵,以支持稳定且可解释的稀疏性?

主要发现

  • 该方法在交通速度预测任务中实现了5.4957%的平均绝对百分比误差(MAPE),优于基线I(5.5160%)和基线II(5.6343%),尽管其非零参数显著更少。
  • 该模型仅学习了1,009个非零参数(基线I为878个,基线II为28,900个),在保持性能的同时实现了高度稀疏性。
  • 所学的邻接矩阵在$k=1$时的“学习关系”(LR)得分为88.62%,在$k=2$时为91.39%,表明与实际道路连通性高度一致。
  • 该方法在不依赖真实连通性信息的情况下,成功学习到稀疏且有意义的道路段间关系,优于使用完整邻接矩阵的基线方法。
  • 通过结合可微归一化与$l_{0.5}$-范数正则化,实现了有效且结构化的稀疏性,而无需解析求解近端算子。
  • 数值实验确认,平衡归一化可产生近似双随机矩阵,但其理论解释仍为开放问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。