[论文解读] Hidden-Fold Networks: Random Recurrent Residuals Using Sparse Supermasks
该论文提出隐藏折叠网络(HFNs),一种通过折叠残差连接并利用稀疏超掩码在无权重更新的情况下发现高精度子网络,将ResNets压缩为高度高效的循环架构的方法。HFN在CIFAR100和ImageNet上实现了与ResNet相当的性能,同时模型参数量减少26.8倍至38.5倍,显著降低内存占用,通过在片上复用随机权重和二值超掩码,最小化片外内存访问,从而实现在专用硬件上的超低功耗推理。
Deep neural networks (DNNs) are so over-parametrized that recent research has found them to already contain a subnetwork with high accuracy at their randomly initialized state. Finding these subnetworks is a viable alternative training method to weight learning. In parallel, another line of work has hypothesized that deep residual networks (ResNets) are trying to approximate the behaviour of shallow recurrent neural networks (RNNs) and has proposed a way for compressing them into recurrent models. This paper proposes blending these lines of research into a highly compressed yet accurate model: Hidden-Fold Networks (HFNs). By first folding ResNet into a recurrent structure and then searching for an accurate subnetwork hidden within the randomly initialized model, a high-performing yet tiny HFN is obtained without ever updating the weights. As a result, HFN achieves equivalent performance to ResNet50 on CIFAR100 while occupying 38.5x less memory, and similar performance to ResNet34 on ImageNet with a memory size 26.8x smaller. The HFN will become even more attractive by minimizing data transfers while staying accurate when it runs on highly-quantized and randomly-weighted DNN inference accelerators. Code available at https://github.com/Lopez-Angel/hidden-fold-networks
研究动机与目标
- 为解决大型深度神经网络(DNNs)带来的高内存与高能耗问题,将ResNets压缩为高度高效、低内存的架构。
- 利用彩票券假说和在随机初始化网络中发现子网络的方法,在折叠的循环结构中寻找高精度、未经训练的子网络。
- 通过在片上存储稀疏超掩码和随机种子,最小化片外内存访问,实现能效高效的DNN推理。
- 探究将ResNets折叠为循环结构是否能提升隐藏子网络的准确性,相比标准前馈模型。
- 设计一种紧凑且高精度的模型,适用于部署在低功耗、高度量化推理加速器上。
提出的方法
- 通过在多个时间步重复使用同一组权重,将标准ResNet折叠为循环架构,降低参数量和内存占用。
- 使用可学习的二值超掩码在随机初始化的折叠网络中识别稀疏且高性能的子网络,且不更新网络权重。
- 通过二值掩码的可微分松弛方法训练超掩码,优化准确率的同时保持稀疏性。
- 在推理过程中利用稀疏超掩码仅选择性激活部分循环复用的权重,实现高效的二元运算。
- 利用随机种子生成固定且非学习的权重,避免将参数存储在片外内存中。
- 设计架构以兼容支持片上随机数生成和二元掩码运算的专用推理加速器。
实验结果
研究问题
- RQ1将ResNet折叠为循环架构后,通过超掩码发现的隐藏子网络的准确性是否优于标准前馈模型?
- RQ2通过结合权重折叠与基于超掩码的子网络发现,深度网络的内存占用可降低到何种程度?
- RQ3在CIFAR100和ImageNet等标准基准上,HFN在准确率和模型大小方面与标准ResNets相比表现如何?
- RQ4HFN是否能通过在片上存储超掩码和随机种子,最小化片外内存访问,从而实现显著的能效节省?
- RQ5为在最大化HFN准确率的同时最小化模型大小和计算成本,最优的超掩码密度和训练调度策略是什么?
主要发现
- HFN在CIFAR100上实现了与ResNet50相当的准确率,但内存仅需其1/38.5,模型大小减少38.5倍。
- 在ImageNet上,HFN以26.8倍于原始模型的更小内存占用,达到ResNet34的性能水平。
- 在45 nm CMOS推理加速器上,由于片外内存访问极低,从DRAM加载模型的能耗降低了两个数量级。
- 在单张RTX 3090上,HFN的超掩码训练耗时为每轮149秒,而完整ResNet50仅需44秒,表明训练成本有所增加,但换来了巨大的推理节能收益。
- 该方法使模型可在专用硬件上部署,仅通过随机种子和稀疏二值超掩码将参数存储在片上SRAM中,无需访问DRAM。
- 即使使用高度量化权重和二值超掩码,HFN的性能依然保持稳定,使其特别适合能效优先、低精度推理加速器的应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。