[论文解读] Deep Fried Convnets
本文提出自适应快速食品变换(Adaptive Fastfood transform),一种可微分方法,用于重参数化卷积神经网络中的全连接层,将参数量从 O(nd) 降低至 O(n),计算量从 O(nd) 降至 O(n log d)。使用该方法的深度炸裂卷积网络在 MNIST 和 ImageNet 上实现了最先进性能,参数量最多减少 55%,优于训练后低秩分解与剪枝技术。
The fully connected layers of a deep convolutional neural network typically contain over 90% of the network parameters, and consume the majority of the memory required to store the network parameters. Reducing the number of parameters while preserving essentially the same predictive performance is critically important for operating deep neural networks in memory constrained environments such as GPUs or embedded devices. In this paper we show how kernel methods, in particular a single Fastfood layer, can be used to replace all fully connected layers in a deep convolutional neural network. This novel Fastfood layer is also end-to-end trainable in conjunction with convolutional layers, allowing us to combine them into a new architecture, named deep fried convolutional networks, which substantially reduces the memory footprint of convolutional networks trained on MNIST and ImageNet with no drop in predictive performance.
研究动机与目标
- 在不牺牲预测性能的前提下,减少深度卷积网络中全连接层的参数数量。
- 通过使参数压缩可微分,实现压缩网络的端到端训练。
- 解决大型全连接层效率低下的问题,尽管其计算成本较低,却占用了绝大部分参数量。
- 探究结构化随机投影是否可有效适配大规模视觉任务(如 ImageNet)。
- 比较自适应与非自适应随机投影在深度学习设置下的性能表现。
提出的方法
- 提出自适应快速食品变换,作为全连接层中矩阵-向量乘法的可微重参数化方法。
- 将快速食品变换推广至允许自适应权重,从而支持端到端训练。
- 使用带有可学习参数的结构化随机投影,以近似稠密权重矩阵。
- 将该变换应用于标准卷积架构中的全连接层,形成“深度炸裂卷积网络”(deep fried convnets)。
- 采用参数共享机制,将存储量从 O(nd) 降低至 O(n),计算量从 O(nd) 降低至 O(n log d)。
- 将该变换集成至网络训练流程中,实现卷积与全连接组件的联合优化。
实验结果
研究问题
- RQ1是否可通过可微分的结构化随机投影方法,在不降低模型精度的前提下减少全连接层的参数量?
- RQ2在 ImageNet 等大规模数据集上,自适应快速食品变换与非自适应随机投影的性能表现如何?
- RQ3与训练后低秩分解或剪枝相比,使用自适应快速食品变换进行端到端训练是否能获得更优结果?
- RQ4在不造成显著精度损失的前提下,输出 Softmax 层最多可压缩多少?
- RQ5所提方法是否能实现在资源受限环境下的大型模型高效训练与部署?
主要发现
- 使用自适应快速食品变换的深度炸裂卷积网络在 ImageNet 上实现 55% 的参数量减少(3280 万参数),仅导致与参考模型(5870 万参数)相比 0.14% 的 Top-1 错误率增加。
- 该方法优于训练后 SVD 分解:SVD-half-F 将参数量减少至 4660 万,但错误率上升至 42.73%;而自适应快速食品 32 在更少参数下仅导致 41.93% 的错误率。
- 对自适应快速食品 32 模型的最终 Softmax 层应用 SVD 进一步将参数量减少 1250 万(至 2030 万),代价约为 0.7% 的错误率增加。
- 自适应快速食品 16 实现 28% 的参数量减少(1640 万参数),Top-1 错误率为 42.90%,展现出优异的效率-精度权衡。
- 自适应版本在 ImageNet 上显著优于非自适应快速食品,证明学习投影参数对大规模视觉任务至关重要。
- 该方法可在训练阶段实现显著的参数压缩,而不同于剪枝或 SVD 等后处理技术,后者需先完整训练模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。