[论文解读] Deformable Butterfly: A Highly Structured and Sparse Linear Transform
本文提出了一种新型结构化稀疏线性变换——可变形蝴蝶矩阵(Deformable Butterfly, DeBut),其将传统蝴蝶矩阵推广至支持任意输入输出维度,实现了高效、可学习且分层的线性映射。DeBut在保持准确率的同时,实现了高模型压缩率与低推理复杂度,在参数效率和性能方面优于低秩分解与现有结构化变换。
We introduce a new kind of linear transform named Deformable Butterfly (DeBut) that generalizes the conventional butterfly matrices and can be adapted to various input-output dimensions. It inherits the fine-to-coarse-grained learnable hierarchy of traditional butterflies and when deployed to neural networks, the prominent structures and sparsity in a DeBut layer constitutes a new way for network compression. We apply DeBut as a drop-in replacement of standard fully connected and convolutional layers, and demonstrate its superiority in homogenizing a neural network and rendering it favorable properties such as light weight and low inference complexity, without compromising accuracy. The natural complexity-accuracy tradeoff arising from the myriad deformations of a DeBut layer also opens up new rooms for analytical and practical research. The codes and Appendix are publicly available at: https://github.com/ruilin0212/DeBut.
研究动机与目标
- 解决现有结构化线性变换的局限性,例如固定为2的幂次维度及在大型网络中可扩展性差的问题。
- 开发一种可学习、结构化且稀疏的线性变换,支持可变的输入输出维度,并实现有效的神经网络压缩。
- 通过单一、分层且高效的变换机制,统一全连接层与卷积层的表示。
- 提出一种与量化、剪枝和低秩分解正交的新网络压缩范式。
- 在边缘AI场景中实现高效线性层的实际部署,显著降低训练与推理开销。
提出的方法
- DeBut通过引入非方阵、可变形的因子矩阵,将传统蝴蝶矩阵推广至支持任意输入输出维度。
- 其采用具有可变中间维度的分层稀疏可学习蝴蝶因子链,支持在复杂度与表征能力之间进行权衡的膨胀型与单调型配置。
- 通过递归稀疏矩阵乘法实现从细粒度到粗粒度的特征映射,模拟卷积神经网络中的感受野行为。
- 该方法采用结构化稀疏矩阵的乘积链,其中密集块可调节以控制表征容量与稀疏性。
- DeBut被设计为全连接层与卷积层的即插即用替代品,无需任何网络架构修改。
- 得益于其递归的蝴蝶状结构,该方法可利用快速矩阵-向量乘法方案,实现低推理复杂度。
实验结果
研究问题
- RQ1能否设计一种结构化且稀疏的线性变换,使其支持超越2的幂次约束的任意输入输出维度?
- RQ2DeBut的分层可变形结构在深度神经网络中对模型准确率与参数效率有何影响?
- RQ3DeBut在参数数量与准确率方面,相较于低秩分解与其他压缩技术,其优势程度如何?
- RQ4DeBut能否在不损失性能的前提下,通过单一高效变换机制统一全连接层与卷积层?
- RQ5在膨胀型与单调型DeBut链之间进行选择,如何影响模型稳定性、性能与压缩效率?
主要发现
- 在CIFAR-10数据集上的VGG-16-BN模型中,DeBut仅使用2.43M参数,优于Tucker-2(3.21M参数),且准确率更高(93.71% vs. 93.36%)。
- DeBut在显著降低参数量与推理复杂度的同时保持高准确率,适用于边缘AI部署。
- DeBut与量化和剪枝技术正交,结合使用可实现进一步压缩。
- DeBut不依赖低秩结构;所有矩阵因子及整体乘积均为满秩,与低秩分解方法形成鲜明对比。
- DeBut的分层渐进式结构具备潜在的流水线推理加速能力,是未来优化的有前景方向。
- 在训练与推理复杂度至关重要的大型网络中,DeBut展现出卓越的性能与效率,优于现有快速变换方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。