[论文解读] CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers
CrossGET 是一种通用框架,通过跨模态引导和全图软匹配,自适应地减少视觉-语言 Transformer 模型中的令牌数量,从而实现加速。该方法在仅造成极小精度损失(例如,在 BLIP 上损失 -5.19%)的情况下,实现了高达 2.94 倍的 FLOP 减少,同时在多种任务和模型上保持了高性能。
Recent vision-language models have achieved tremendous advances. However, their computational costs are also escalating dramatically, making model acceleration exceedingly critical. To pursue more efficient vision-language Transformers, this paper introduces Cross-Guided Ensemble of Tokens (CrossGET), a general acceleration framework for vision-language Transformers. This framework adaptively combines tokens in real-time during inference, significantly reducing computational costs while maintaining high performance. CrossGET features two primary innovations: 1) Cross-Guided Matching and Ensemble. CrossGET leverages cross-modal guided token matching and ensemble to effectively utilize cross-modal information, achieving wider applicability across both modality-independent models, e.g., CLIP, and modality-dependent ones, e.g., BLIP2. 2) Complete-Graph Soft Matching. CrossGET introduces an algorithm for the token-matching mechanism, ensuring reliable matching results while facilitating parallelizability and high efficiency. Extensive experiments have been conducted on various vision-language tasks, such as image-text retrieval, visual reasoning, image captioning, and visual question answering. The performance on both classic multimodal architectures and emerging multimodal LLMs demonstrates the framework's effectiveness and versatility. The code is available at https://github.com/sdc17/CrossGET.
研究动机与目标
- 解决大型视觉-语言 Transformer 模型日益增长的计算成本,尤其是在资源受限环境下的挑战。
- 克服现有针对多模态、基于交叉注意力机制模型的高效令牌压缩技术的不足。
- 实现在模态无关(如 CLIP)和模态相关(如 BLIP)架构上的高效推理。
- 在性能下降极小的前提下实现显著加速,并保持可忽略的参数开销。
- 提供一种通用、可训练且可部署的框架,适用于低性能设备的实时推理。
提出的方法
- 提出跨模态引导匹配与集成:利用跨模态令牌作为轻量级代理,引导模态内令牌的选择与加权集成,实现双向跨模态信息利用。
- 采用全图软匹配机制:近似全图匹配策略,以提升匹配可靠性,同时保持并行化与高效性,优于二分图匹配方法。
- 在推理阶段应用该框架,无需微调,支持根据计算预算动态进行模型压缩。
- 在视觉与语言分支中注入极少的交叉注意力参数,以计算跨模态重要性分数,用于令牌选择。
- 利用学习到的重要性分数对匹配后的令牌进行加权集成,以保持模型表征的保真度。
- 支持零样本与微调后模型的适配,无需重新训练即可在不同压缩比例下重新评估性能。
实验结果
研究问题
- RQ1跨模态引导能否有效识别视觉-语言 Transformer 中的冗余令牌,以实现高效推理?
- RQ2与二分图匹配相比,全图软匹配策略是否能在保持并行性的同时提升令牌匹配的可靠性?
- RQ3CrossGET 是否可无需架构修改,通用地应用于模态无关与模态相关的视觉-语言模型?
- RQ4CrossGET 在多类视觉-语言任务中,能在多大程度上减少 FLOPs 同时保持性能?
- RQ5该框架是否可在无需重新训练或微调的前提下,实现实时推理阶段的动态模型压缩?
主要发现
- 在 NVLR2 数据集的视觉推理任务中,CrossGET 对 BLIP 模型实现了高达 2.94 倍的 FLOP 减少,精度损失仅为 5.19%(在训练后);在无微调情况下,实现 2.26 倍的 FLOP 减少。
- 在图像-文本检索任务的 CLIP 模型上,CrossGET 在 1.04 倍推理加速(12.56 GFLOPs)下保持 86.20% 的 Recall@1,且无需微调,效率优于原始模型。
- 该框架支持对单个训练好的模型在多种压缩比例下重新评估,实现了 1.04 倍至 2.94 倍的推理加速,适用于不同计算预算。
- 在各类任务中,CrossGET 将 FLOPs 减少 1.71 倍至 2.94 倍,同时与同类压缩水平下的基线模型相比,保持或略微提升了精度。
- 全图软匹配策略提升了匹配可靠性,使令牌压缩中的性能增益更加一致,优于二分图匹配方法。
- CrossGET 引入的参数开销可忽略不计(例如,额外参数 <0.1%),使其在资源受限设备上高度高效且易于部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。