Skip to main content
QUICK REVIEW

[论文解读] Finding trainable sparse networks through Neural Tangent Transfer

Tianlin Liu, Friedemann Zenke|arXiv (Cornell University)|Jun 15, 2020
Neural Networks and Applications参考文献 35被引用 4
一句话总结

该论文提出神经正切迁移(NTT),一种无标签的前瞻剪枝方法,通过匹配其训练动态(由神经正切核(NTK)表征)与稠密网络的训练动态,识别可训练的稀疏神经网络。该方法无需依赖标注数据,可在稀疏卷积神经网络中实现更快收敛和更高准确率,尤其在剪枝卷积层方面表现优异。

ABSTRACT

Deep neural networks have dramatically transformed machine learning, but their memory and energy demands are substantial. The requirements of real biological neural networks are rather modest in comparison, and one feature that might underlie this austerity is their sparse connectivity. In deep learning, trainable sparse networks that perform well on a specific task are usually constructed using label-dependent pruning criteria. In this article, we introduce Neural Tangent Transfer, a method that instead finds trainable sparse networks in a label-free manner. Specifically, we find sparse networks whose training dynamics, as characterized by the neural tangent kernel, mimic those of dense networks in function space. Finally, we evaluate our label-agnostic approach on several standard classification tasks and show that the resulting sparse networks achieve higher classification performance while converging faster.

研究动机与目标

  • 开发一种无标签方法,以识别训练动态与稠密网络相似的可训练稀疏神经网络。
  • 克服现有前瞻剪枝方法依赖标注数据或全局剪枝准则的局限性。
  • 实现对计算成本高昂的卷积滤波器的有效逐层稀疏化,以实现能效更高的推理。
  • 利用神经正切核(NTK)确保稀疏网络具有良好泛化能力并实现快速训练。
  • 提供一种理论基础扎实、基于初始化的方法,将稠密网络的训练动态迁移至稀疏网络。

提出的方法

  • 该方法利用神经正切核(NTK)在初始化阶段比较稀疏网络与稠密网络在函数空间中的训练动态。
  • 基于最小化稀疏网络在函数空间中 NTK 与稠密网络 NTK 偏差的准则,制定剪枝标准。
  • 该方法与标签无关,仅依赖无标签数据计算 NTK 矩阵并指导剪枝。
  • NTT 执行逐层剪枝,特别针对卷积滤波器,以最大化计算效率。
  • 该方法识别出能保持稠密网络训练轨迹的稀疏网络结构,确保快速收敛和高准确率。
  • 它利用线性化神经网络和 NTK 理论的理论洞见,确保训练动态稳定且可泛化。

实验结果

研究问题

  • RQ1无标签方法能否识别出训练动态与稠密网络匹配的可训练稀疏神经网络?
  • RQ2NTT 能否有效实现卷积滤波器的逐层稀疏化,从而提升 CNN 的能效?
  • RQ3NTT 在收敛速度和最终准确率方面是否优于现有前瞻剪枝方法?
  • RQ4NTT 在不同稀疏度水平和网络架构下的性能表现如何?
  • RQ5在无需监督信号的情况下,能否实现从稠密网络到稀疏网络的 NTK 基训练动态迁移?

主要发现

  • NTT 在无需任何标注数据的情况下成功识别出可训练的稀疏神经网络,适用于数据稀缺场景。
  • 在 CIFAR-10 和 MNIST 基准测试中,该方法的分类准确率高于基线剪枝方法。
  • NTT 实现了更快收敛,稀疏网络在更少训练轮次内即可达到高准确率,优于标准剪枝基线。
  • 通过 NTT 实现的逐层剪枝显著降低了计算成本,因为卷积滤波器是 CNN 中 FLOPs 的主要来源。
  • 在 1% 稀疏度下实现了高达 4 倍的理论加速,且准确率损失极小,展现出优异的效率-准确率权衡。
  • NTT 在保持训练动态方面优于现有前瞻剪枝方法,尤其在全局剪枝失效的卷积层中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。