[论文解读] UPop: Unified and Progressive Pruning for Compressing Vision-Language Transformers
UPop 是一种统一且渐进的剪枝框架,用于压缩视觉-语言 Transformer 模型,通过连续优化实现视觉、语言和跨注意力模块之间的自动、自适应剪枝比例分配,同时通过渐进式微调确保收敛性和性能提升。该方法在图像分类、图像字幕和语义分割任务中实现了高达 2× 的压缩率,且精度损失低于 1%。
Real-world data contains a vast amount of multimodal information, among which vision and language are the two most representative modalities. Moreover, increasingly heavier models, extit{e}. extit{g}., Transformers, have attracted the attention of researchers to model compression. However, how to compress multimodal models, especially vison-language Transformers, is still under-explored. This paper proposes the extbf{U}nified and extbf{P}r extbf{o}gressive extbf{P}runing ( extbf{\emph{UPop}}) as a universal vison-language Transformer compression framework, which incorporates 1) unifiedly searching multimodal subnets in a continuous optimization space from the original model, which enables automatic assignment of pruning ratios among compressible modalities and structures; 2) progressively searching and retraining the subnet, which maintains convergence between the search and retrain to attain higher compression ratios. Experiments on various tasks, datasets, and model architectures demonstrate the effectiveness and versatility of the proposed UPop framework. The code is available at https://github.com/sdc17/UPop.
研究动机与目标
- 解决视觉-语言 Transformer 模型日益庞大且资源密集,却缺乏高效、系统化压缩方法的问题。
- 克服多模态剪枝中手动分配剪枝比例效率低下且次优的问题。
- 通过渐进式搜索与微调,实现在保持模型收敛性和性能的前提下实现高剪枝率。
- 提供一种适用于多种视觉-语言任务、数据集和模型架构的通用框架。
- 通过自动分配不同模态和结构(如自注意力、前馈网络)的剪枝比例,实现无损失或近无损失压缩。
提出的方法
- 提出一种统一的连续优化搜索空间,联合搜索视觉、语言和跨注意力模块的剪枝比例。
- 引入可学习掩码($\bm{\zeta}$)并施加正则化,实现可微剪枝,支持通过梯度优化剪枝比例。
- 采用渐进式剪枝范式:首先在连续空间中搜索子网络,然后通过微调权重对子网络进行再训练以弥合性能差距。
- 采用两阶段训练方案:第一阶段为搜索阶段,学习率设为 $\alpha$;第二阶段为再训练阶段,学习率设为 $\beta$,以稳定收敛。
- 通过总压缩率 $p$ 控制整体模型大小,各组件的剪枝比例通过端到端方式确定。
- 通过统一方式联合剪枝视觉分支和语言分支(包括跨注意力模块),将方法扩展至多模态任务。
实验结果
研究问题
- RQ1统一的连续优化框架能否自动分配视觉-语言 Transformer 中视觉、语言和跨注意力模块的最优剪枝比例?
- RQ2与标准的一次性剪枝相比,渐进式微调是否能显著提升收敛性与性能,尤其是在高剪枝率下?
- RQ3在多模态任务中,UPop 与现有单模态剪枝基线方法(如 ViT-Slimming)相比,在精度和压缩效率方面表现如何?
- RQ4UPop 能否在多种视觉-语言任务中实现接近无损压缩(≤1% 精度损失)的高剪枝率(如 2×)?
- RQ5UPop 在不同任务(如图像分类与语义分割)中的性能表现如何,尤其是在冗余程度不同的情况下?
主要发现
- 在 DeiT 模型上,UPop 实现了高达 2× 的压缩率(1140 万参数),top-1 精度仅下降 1.0%,优于同类基线方法在相似压缩率下的表现。
- 在图像分类任务中,UPop 在 1.11× 压缩率(1990 万参数)下保持 81.1 的 top-1 精度,较原始 DeiT 模型提升 1.2%。
- 在 ADE20k 语义分割任务中,UPop 实现 1.1× 压缩率,mIoU 提升 0.6%(45.9 vs. 45.3),FLOPs 减少 13%,表现优于基线。
- 在 1.42× 压缩率下,UPop 保持 80.2 的 top-1 精度(仅下降 0.3%),FLOPs 减少 30%,展现出在高剪枝率下的强大性能。
- UPop 在图像分类任务中实现 1.5× 无损失压缩,在语义分割任务中实现 1.4× 压缩率且 mIoU 损失 <1%,表明分类任务具有更高的可压缩性。
- 渐进式微调方案显著提升了收敛性,使高剪枝率下性能不降反升,而标准剪枝方法则难以实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。