Skip to main content
QUICK REVIEW

[论文解读] Fully Learnable Group Convolution for Acceleration of Deep Neural Networks

Xijun Wang, Meina Kan|arXiv (Cornell University)|Mar 31, 2019
Advanced Neural Network Applications参考文献 44被引用 4
一句话总结

本文提出完全可学习组卷积(FLGC),一种新型组卷积模块,可在端到端训练过程中自动学习最优的通道与滤波器分组,实现显著加速且不损失精度。FLGC 通过动态学习分组结构并支持任意分组数量,在 CPU 上实现比 ResNet50 快达 5 倍的加速,其在精度与效率方面均优于标准组卷积和可学习组卷积方法。

ABSTRACT

Benefitted from its great success on many tasks, deep learning is increasingly used on low-computational-cost devices, e.g. smartphone, embedded devices, etc. To reduce the high computational and memory cost, in this work, we propose a fully learnable group convolution module (FLGC for short) which is quite efficient and can be embedded into any deep neural networks for acceleration. Specifically, our proposed method automatically learns the group structure in the training stage in a fully end-to-end manner, leading to a better structure than the existing pre-defined, two-steps, or iterative strategies. Moreover, our method can be further combined with depthwise separable convolution, resulting in 5 times acceleration than the vanilla Resnet50 on single CPU. An additional advantage is that in our FLGC the number of groups can be set as any value, but not necessarily 2^k as in most existing methods, meaning better tradeoff between accuracy and speed. As evaluated in our experiments, our method achieves better performance than existing learnable group convolution and standard group convolution when using the same number of groups.

研究动机与目标

  • 为解决深度神经网络在智能手机和嵌入式系统等资源受限设备上的高计算与内存开销问题。
  • 克服现有组卷积方法在分组结构选择上依赖预定义、两步或迭代策略的局限性。
  • 开发一种灵活、可端到端训练的组卷积模块,可无缝集成到任意深度神经网络架构中。
  • 支持任意分组数量(不限于 2 的幂次),以实现更优的精度-速度权衡。
  • 通过动态分组结构学习实现显著的推理加速,同时保持或提升模型精度。

提出的方法

  • 提出一种完全可学习组卷积(FLGC)模块,在反向传播过程中以端到端方式联合学习输入通道与卷积滤波器的分组方式。
  • 引入一种可微分的分组机制,使网络能够基于整体网络损失自动确定输入通道与滤波器的最优分组分配。
  • 支持任意分组数量(不限于 2^k),实现更灵活且高效的精度-速度权衡。
  • 将 FLGC 与深度可分离卷积结合,进一步加速推理,在单核 CPU 上实现比原始 ResNet50 快 5 倍的性能。
  • 采用标准残差块架构,用 FLGC 替换 1×1 卷积,并使用余弦退火学习率策略训练 120 个周期。
  • 采用与基线模型(如 CondenseNet)相同的超参数以确保公平比较,确保性能提升源于 FLGC 模块本身。

实验结果

研究问题

  • RQ1能否训练一种组卷积模块,使其在无需预定义或迭代策略的情况下,自动学习最优的通道与滤波器分组?
  • RQ2允许任意分组数量(不限于 2 的幂次)是否能带来优于传统组卷积方法的精度-速度权衡?
  • RQ3FLGC 是否能与深度可分离卷积有效结合,在不损失精度的前提下实现 CPU 上更大的加速?
  • RQ4与最先进可学习组卷积(如 CondenseNet 中的 LGC)和标准组卷积相比,FLGC 在精度与计算效率方面表现如何?
  • RQ5FLGC 是否能灵活嵌入多种网络架构(如 ResNet、MobileNetV2)中,在保持性能的同时加速推理?

主要发现

  • 在相同架构与分组数量下,FLGC 在 ImageNet 上实现 6.77% 的 top-1 错误率,44M FLOPs,优于标准组卷积(29.0% 错误率)和 LGC(26.2% 错误率)。
  • 在 CIFAR-10 上,ResNet50-FLGC2 实现 6.77% 错误率,44M FLOPs,优于 ResNet56-pruned [25](90M FLOPs 时错误率为 6.94%)和 ResNet56-pruned [14](62M FLOPs 时错误率为 8.2%)。
  • MobileNetV2-FLGC 在 8 组下实现 6.91% 的 top-1 错误率,76M FLOPs,优于 MobileNetV2-SGC(7.51% 错误率),并接近 NASNet-A 等更大模型的性能。
  • 当与深度可分离卷积结合时,FLGC 在单核 CPU 上实现比原始 ResNet50 快达 5 倍的推理加速。
  • 该方法支持任意分组数量(如 G=2 至 G=8),且随着分组数量增加,性能保持稳定或进一步提升,展现出鲁棒性与灵活性。
  • FLGC 在保持相似或更低 FLOP 数量的同时,精度优于标准组卷积和 CondenseNet 中的 LGC,证明其在端到端学习分组结构方面的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。