[论文解读] Seesaw-Net: Convolution Neural Network With Uneven Group Convolution
Seesaw-Net 引入了不均衡分组卷积以及两种新颖的信息流模式——Seesaw-shuffle 和 Seesaw-share,以在不依赖通道混洗操作的情况下提升轻量级 CNN 的表征能力。该方法在 ImageNet 和 CIFAR 基准上实现了最先进(SOTA)的准确率,且计算成本极低,优于 MobileNet-V2 和 IGCV3 等模型在相似约束下的表现。
In this paper, we are interested in boosting the representation capability of convolution neural networks which utilizing the inverted residual structure. Based on the success of Inverted Residual structure[Sandler et al. 2018] and Interleaved Low-Rank Group Convolutions[Sun et al. 2018], we rethink this two pattern of neural network structure, rather than NAS(Neural architecture search) method[Zoph and Le 2017; Pham et al. 2018; Liu et al. 2018b], we introduce uneven point-wise group convolution, which provide a novel search space for designing basic blocks to obtain better trade-off between representation capability and computational cost. Meanwhile, we propose two novel information flow patterns that will enable cross-group information flow for multiple group convolution layers with and without any channel permute/shuffle operation. Dense experiments on image classification task show that our proposed model, named Seesaw-Net, achieves state-of-the-art(SOTA) performance with limited computation and memory cost. Our code will be open-source and available together with pre-trained models.
研究动机与目标
- 在不增加计算成本的前提下,提升面向移动端的 CNN 的表征能力。
- 解决传统均匀分组卷积的局限性,尽管其计算量最小,但未必总能实现最优性能。
- 基于不均衡分组策略,设计一种新的神经架构搜索(NAS)搜索空间。
- 在不依赖昂贵的通道混洗操作的前提下,实现在分组卷积层中的有效跨组信息流。
- 开发一种适用于资源受限的移动端和边缘设备的内存与计算效率俱佳的架构。
提出的方法
- 引入不均衡逐点分组卷积,将输入和输出通道划分为不相等的组大小(例如 1:2 比例),形成稀疏且结构化的分组模式。
- 提出 Seesaw-shuffle 模块,通过相邻不均衡组之间的结构化置换机制,实现在组间的跨组信息流动。
- 引入 Seesaw-share 模块,通过相邻不均衡分组卷积之间的直接通道共享实现跨组信息流,从而消除对通道混洗操作的需求。
- 采用稀疏分组卷积核,构建鲁棒且高效的神经结构基元,保持高表征能力。
- 设计一种基于混合分组策略的新型 NAS 搜索空间,突破传统均匀分组和固定卷积核模式的限制。
- 使用标准深度学习操作,确保与现有框架的兼容性,并降低推理开销。
实验结果
研究问题
- RQ1与传统的均匀分组卷积相比,不均衡分组卷积是否能提升轻量级 CNN 的表征能力?
- RQ2在分组卷积层中,是否可以在不使用通道混洗操作的情况下实现有效的跨组信息流?
- RQ3所提出的 Seesaw 模块设计是否能实现优于 MobileNet-V2 和 IGCV3 等现有移动端架构的准确率-效率权衡?
- RQ4Seesaw-Net 架构在不同数据集和模型规模下表现如何,特别是在严格的 FLOPs 和参数约束下?
- RQ5该方法是否可泛化至非倒残差结构的其他神经模块设计?
主要发现
- 在 CIFAR-10 上,Seesaw-Net 使用 0.5× 深度乘数时达到 95.09% 的 top-1 准确率,优于使用通道混洗的 IGCV3(0.5D)(94.83%)和 Seesaw-shareNet(v1)(94.56%),且在相似 FLOPs 下表现更优。
- Seesaw-shareNet 变体在不使用通道混洗的情况下,于 CIFAR-10 上达到 94.56% 的 top-1 准确率,证明了无需昂贵混洗操作即可实现跨组信息流。
- 在 CIFAR-100 上,Seesaw-shareNet(v1 0.5D) 达到 76.14% 的 top-1 准确率,超过 IGCV3(0.5D) 的 75.75%,仅增加 4M 参数和 4M FLOPs。
- 该模型在 ImageNet 上实现了最先进性能,且计算与内存成本极低,验证了其高效性与可扩展性。
- 在固定 FLOP 和通道约束下,不均衡分组卷积相比均匀分组卷积展现出更强的表征能力,挑战了“均匀分组为最优”的假设。
- 所提出的 Seesaw 模块实现了组间高效的信息流动,减少了通常与稀疏分组策略相关的性能退化问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。