Skip to main content
QUICK REVIEW

[论文解读] All You Need is a Few Shifts: Designing Efficient Convolutional Neural Networks for Image Classification

Weijie Chen, Di Xie|arXiv (Cornell University)|Mar 13, 2019
Advanced Neural Network Applications参考文献 38被引用 11
一句话总结

本文提出了一种新型高效的卷积神经网络组件——稀疏移位层(Sparse Shift Layer, SSL),通过仅在特征图中战略性地应用少量移位操作,替代深度可分离卷积。通过引入可学习的移位惩罚和量化感知训练,SSL 实现了极低的计算成本与高精度——在仅 563M M-Adds 的情况下,ImageNet 上达到 75.0% 的 top-1 准确率,优于 MobileNet、ShuffleNet 和 NAS 搜索得到的模型,在准确率和推理速度方面均表现更优。

ABSTRACT

Shift operation is an efficient alternative over depthwise separable convolution. However, it is still bottlenecked by its implementation manner, namely memory movement. To put this direction forward, a new and novel basic component named Sparse Shift Layer (SSL) is introduced in this paper to construct efficient convolutional neural networks. In this family of architectures, the basic block is only composed by 1x1 convolutional layers with only a few shift operations applied to the intermediate feature maps. To make this idea feasible, we introduce shift operation penalty during optimization and further propose a quantization-aware shift learning method to impose the learned displacement more friendly for inference. Extensive ablation studies indicate that only a few shift operations are sufficient to provide spatial information communication. Furthermore, to maximize the role of SSL, we redesign an improved network architecture to Fully Exploit the limited capacity of neural Network (FE-Net). Equipped with SSL, this network can achieve 75.0% top-1 accuracy on ImageNet with only 563M M-Adds. It surpasses other counterparts constructed by depthwise separable convolution and the networks searched by NAS in terms of accuracy and practical speed.

研究动机与目标

  • 为解决深度可分离卷积在实际应用中因高内存移动开销而导致的效率低下问题。
  • 探究通过引入稀疏性减少冗余移位操作,是否可使移位操作更加高效。
  • 设计一种全新的轻量化神经网络架构,仅通过稀疏移位操作充分利用神经网络的有限容量。
  • 证明当移位操作经过适当的正则化和量化处理后,可在准确率和推理速度方面超越深度可分离卷积。

提出的方法

  • 提出稀疏移位层(SSL),仅在中间特征图上应用少量可学习的移位操作,从而降低内存移动开销。
  • 在优化过程中引入移位操作惩罚,以鼓励稀疏性,仅允许一小部分特征图被移位。
  • 开发一种量化感知的移位学习方法,使移位操作在不使用插值的情况下具备可微性,同时保持推理效率。
  • 设计一种新网络架构 FE-Net,仅通过 1x1 卷积和稀疏移位操作,最大化特征多样性与信息流。
  • 使用宽度乘数作为超参数,控制 FE-Net 中准确率与计算成本之间的权衡。
  • 在倒置瓶颈结构的扩展路径中集成 SE 模块,以增强通道注意力,进一步提升移位稀疏性。

实验结果

研究问题

  • RQ1少量战略性放置的移位操作是否足以在 CNN 中实现有效的空间信息传递?
  • RQ2通过稀疏性减少内存移动开销,是否可使移位操作比深度可分离卷积更高效?
  • RQ3完全不使用深度可分离卷积构建的网络,是否能在准确率和推理速度方面超越现有紧凑模型?
  • RQ4通道注意力(通过 SE 模块实现)如何影响基于 SSL 的架构中的移位稀疏性与模型性能?

主要发现

  • 仅需少量移位操作即可实现有效的空间信息通信,训练模型中 60–80% 的特征图保持未移位状态。
  • 所提出的 FE-Net 搭载 SSL 在 ImageNet 上实现 75.0% 的 top-1 准确率,仅需 563M M-Adds,优于 MobileNetV2 和 NAS 搜索得到的模型。
  • 在 GPU 和 CPU 上,FE-Net 搭载 SSL 的推理速度显著快于 MobileNetV2,批量大小为 32 时,GPU 上耗时 16.1ms,CPU 上耗时 1.9s。
  • 集成 SE 模块后,移位稀疏性从 69.5% 提升至 80.2%,表明通道注意力可增强稀疏移位的效率。
  • FE-Net 搭载 SSL 在准确率和实际运行时间方面,均优于基于深度可分离卷积的模型(如 MobileNet、ShuffleNet)以及 NAS 优化的网络。
  • 量化感知的移位学习方法实现了无需插值的可微训练,同时在推理阶段保持了硬件效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。