Skip to main content
QUICK REVIEW

[论文解读] Distilling Critical Paths in Convolutional Neural Networks

Fuxun Yu, Zhuwei Qin|arXiv (Cornell University)|Oct 28, 2018
Advanced Neural Network Applications参考文献 5被引用 20
一句话总结

本文提出关键路径蒸馏(critical path distillation),一种通过识别并仅保留卷积神经网络(CNN)高层卷积层中最具类别特异性的神经元来实现模型高效压缩的方法,无需微调。通过分析滤波器激活、梯度和可视化,该方法识别出针对各个类别的专属‘关键路径’,在保持98.6%的平均真正例率(one-vs-all任务)的同时,将神经元数量减少90%,模型大小缩小至11.4MB。

ABSTRACT

Neural network compression and acceleration are widely demanded currently due to the resource constraints on most deployment targets. In this paper, through analyzing the filter activation, gradients, and visualizing the filters' functionality in convolutional neural networks, we show that the filters in higher layers learn extremely task-specific features, which are exclusive for only a small subset of the overall tasks, or even a single class. Based on such findings, we reveal the critical paths of information flow for different classes. And by their intrinsic property of exclusiveness, we propose a critical path distillation method, which can effectively customize the convolutional neural networks to small ones with much smaller model size and less computation.

研究动机与目标

  • 探究高层CNN滤波器中是否存在类别特异性的、独占的信息流路径。
  • 开发一种基于滤波器任务特定贡献度的筛选方法,实现对非必要滤波器的选择性剪枝,以压缩CNN模型。
  • 通过蒸馏单类别决策路径实现高效、任务特定的模型部署,且无需微调。
  • 证明通过激活、梯度和可视化分析可识别关键路径,从而实现结构化压缩。

提出的方法

  • 利用跨类别的平均绝对激活值识别关键神经元,以衡量滤波器对各类别的响应能力。
  • 通过一阶泰勒近似计算贡献指数,量化滤波器对特定类别logits的影响程度。
  • 采用激活最大化(AM)可视化方法,解释并验证滤波器的功能性及其类别偏好。
  • 结合激活值、贡献指数与AM可视化结果,交叉验证各分类对应的独占关键路径的存在性。
  • 基于平均激活值与贡献指数的乘积选择用于蒸馏的滤波器,保留比例(如10%)用于控制压缩程度。
  • 从高层移除所有非关键滤波器,将logit层偏置设为零,并部署蒸馏后的网络用于one-vs-all分类。

实验结果

研究问题

  • RQ1高层CNN滤波器是否学习到仅属于单个类别或少数类别的特征?
  • RQ2特定类别的信息流是否可通过一组独特且最小化的神经元(即‘关键路径’)被追踪?
  • RQ3类别特异性神经元的独占性是否足以实现无需微调的有效模型蒸馏?
  • RQ4关键路径蒸馏是否能在显著压缩模型的同时,保持one-vs-all任务上的高分类准确率?

主要发现

  • 每个类别的关键路径由高层卷积层中一小部分高度专业化、类别独占的神经元构成。
  • 高层滤波器表现出强烈的类别偏好,其激活值标准差随网络深度增加而上升,表明功能上的专门化。
  • 平均激活值、贡献指数与AM可视化三者结合,交叉验证了各分类关键路径的存在性。
  • 在最后六层卷积层中保留10%的滤波器时,蒸馏后的模型在所有one-vs-all任务上实现了平均98.6%的真正例率。
  • 蒸馏后的模型将原始59.0 MB的模型大小压缩至11.4 MB,高层神经元数量减少90%。
  • 该方法在所有one-vs-all任务上实现了11.0%的平均假正例率,且无需任何微调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。