[论文解读] ExpandNets: Linear Over-parameterization to Train Compact Convolutional Networks
ExpandNets 提出了一种用于紧凑卷积神经网络的新型训练方法,通过线性过参数化将每个线性层扩展为多个连续的线性层(中间无非线性),从而在推理时可代数收缩回原始紧凑网络。该方法提升了优化与泛化性能,在图像分类、目标检测和语义分割任务上均优于从零开始训练和知识蒸馏的方法。
We introduce an approach to training a given compact network. To this end, we leverage over-parameterization, which typically improves both neural network optimization and generalization. Specifically, we propose to expand each linear layer of the compact network into multiple consecutive linear layers, without adding any nonlinearity. As such, the resulting expanded network, or ExpandNet, can be contracted back to the compact one algebraically at inference. In particular, we introduce two convolutional expansion strategies and demonstrate their benefits on several tasks, including image classification, object detection, and semantic segmentation. As evidenced by our experiments, our approach outperforms both training the compact network from scratch and performing knowledge distillation from a teacher. Furthermore, our linear over-parameterization empirically reduces gradient confusion during training and improves the network generalization.
研究动机与目标
- 为解决从零开始高效训练紧凑卷积神经网络的困难。
- 探究线性过参数化是否能改善紧凑网络中的训练动态与泛化性能。
- 开发一种方法,通过扩展网络进行训练,随后进行代数收缩,实现无性能损失的紧凑网络训练。
- 证明线性过参数化可减少梯度混淆并改善优化过程。
- 提供一种实用、即插即用的替代知识蒸馏的方法,用于训练紧凑模型。
提出的方法
- 将紧凑网络中的每个线性层扩展为多个连续的线性层,层间不引入非线性激活。
- 采用三种不同的扩展策略:(i) 将 k×k 卷积替换为 1×1、k×k 和 1×1 卷积;(ii) 将大核卷积(>3×3)替换为多个 3×3 卷积;(iii) 将全连接层扩展为多个线性层。
- 通过代数方式将一系列线性层收缩为单个等效线性变换,保持扩展网络与原始紧凑网络的等价性。
- 利用卷积的矩阵-向量表示,通过标准矩阵乘法计算扩展层的等效权重矩阵。
- 使用 PyTorch 张量操作实现扩展与收缩,确保数值等价性并保持极低的计算开销。
- 端到端训练扩展网络(ExpandNet),随后将其代数收缩回原始架构用于推理。
实验结果
研究问题
- RQ1与从零开始训练相比,紧凑卷积网络的线性过参数化是否能提升训练性能?
- RQ2线性过参数化是否能减少紧凑网络在优化过程中的梯度混淆?
- RQ3在训练紧凑网络时,ExpandNets 是否能优于知识蒸馏?
- RQ4扩展策略的选择(如核大小替换)如何影响紧凑模型的最终性能?
- RQ5线性过参数化在多大程度上改善了紧凑网络的泛化能力与损失曲面特性?
主要发现
- 在 ImageNet、PASCAL VOC 和 Cityscapes 基准上,ExpandNets 在图像分类、目标检测和语义分割任务中均优于从零开始训练紧凑网络的方法。
- 在所有评估任务中,ExpandNets 的性能优于从大型教师网络蒸馏得到的知识蒸馏结果。
- 扩展网络在训练过程中表现出更少的梯度混淆,表现为各层梯度更稳定且相关性更低。
- 线性过参数化导致损失曲面更平坦,这与泛化性能的提升相关。
- 该方法在不同网络架构和任务中均有效,其中核大小扩展策略(用多个 3×3 卷积替换大核卷积)尤为有益。
- 扩展网络的代数收缩过程在数值误差低于 1e-5 的前提下,完全保留了原始模型的参数与推理行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。