[论文解读] Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning
Side4Video 提出了一种内存高效的时空侧边网络,可将大型冻结图像模型(如 ViT-E,44亿参数)高效迁移至视频理解任务,而无需对主干网络进行反向传播。通过利用多级特征和优化组件(如内存高效的时序卷积与 [CLS] token 移位),其内存使用量相比基于适配器的方法减少了 75%,并在多个视频基准测试中达到最先进性能,包括在 Something-Something V2 上达到 74.6% 的准确率,在 VATEX 上达到 68.8%。
Large pre-trained vision models achieve impressive success in computer vision. However, fully fine-tuning large models for downstream tasks, particularly in video understanding, can be prohibitively computationally expensive. Recent studies turn their focus towards efficient image-to-video transfer learning. Nevertheless, existing efficient fine-tuning methods lack attention to training memory usage and exploration of transferring a larger model to the video domain. In this paper, we present a novel Spatial-Temporal Side Network for memory-efficient fine-tuning large image models to video understanding, named Side4Video. Specifically, we introduce a lightweight spatial-temporal side network attached to the frozen vision model, which avoids the backpropagation through the heavy pre-trained model and utilizes multi-level spatial features from the original image model. Extremely memory-efficient architecture enables our method to reduce 75% memory usage than previous adapter-based methods. In this way, we can transfer a huge ViT-E (4.4B) for video understanding tasks which is 14x larger than ViT-L (304M). Our approach achieves remarkable performance on various video datasets across unimodal and cross-modal tasks (i.e., action recognition and text-video retrieval), especially in Something-Something V1&V2 (67.3% & 74.6%), Kinetics-400 (88.6%), MSR-VTT (52.3%), MSVD (56.1%) and VATEX (68.8%). We release our code at https://github.com/HJYao00/Side4Video.
研究动机与目标
- 解决为视频理解任务微调大型预训练图像模型所带来的高计算与内存开销问题。
- 实现在全参数微调不可行的场景下,高效迁移超大视觉模型(如 ViT-E,44亿参数)至视频任务。
- 通过消除对冻结视觉变换器主干网络的反向传播,降低参数高效微调中的内存使用量。
- 探索并优化可增强时序推理能力同时最小化内存占用的架构组件。
- 在单模态(动作识别)与跨模态(图文检索)视频基准测试中,利用大型冻结图像模型实现最先进性能。
提出的方法
- 在冻结的视觉变换器(ViT)主干网络上附加一个轻量级时空侧边网络,接收来自冻结模型的多级空间特征。
- 侧边网络采用分治式时空模块,结合时序卷积、空间自注意力与前馈网络,学习视频表征。
- 通过在侧边网络中移除 [CLS] token、使用内存高效的时序卷积,以及应用 [CLS] token 移位技术,提升内存效率。
- 采用基于间隔的特征融合策略,整合 ViT 编码器中每隔一层的特征,以增强表征学习。
- 最终视频表征通过全局平均池化(GAP)获得,实现性能与内存效率的最佳平衡。
- 通过调节侧边网络中的层数(l)与隐藏维度(d),控制模型复杂度与内存使用量,当内存受限时,优先选择更大的 d 而非更深的 l。
实验结果
研究问题
- RQ1能否在不进行完整微调的前提下,有效且高效地将像 ViT-E(44亿参数)这样的大型冻结图像模型迁移至视频理解任务?
- RQ2如何避免在微调过程中对重型预训练 ViT 主干网络进行反向传播,以降低内存消耗?
- RQ3在侧边网络中,哪些架构选择——如特征融合策略、时序模块类型与表征聚合方式——最能有效提升性能,同时最小化内存使用?
- RQ4与较小模型(如 ViT-L)相比,将图像主干网络扩展至 ViT-E 是否能显著提升视频基准测试的性能?
- RQ5一种避免梯度流经冻结模型的侧边网络设计,是否仍能在多样化的视频任务中实现最先进性能?
主要发现
- 与基于适配器的方法相比,Side4Video 将 GPU 内存使用量减少了 75%,实现了对 ViT-E 等大模型在视频任务上的高效微调。
- 在 Something-Something V2 上,Side4Video 达到 74.6% 的 top-1 准确率,相比之前方法提升 2.2%,同时内存使用量减少 75%。
- 在 MSR-VTT 的图文检索任务中,Side4Video 实现 52.3% 的 Recall@1,较 CLIP4Clip 提升 1.1%,且内存使用量减少 30%。
- 使用 ViT-E/14(参数量为 ViT-L/14 的 14.5 倍)时,Side4Video 在 MSVD(56.1%)与 VATEX(68.8%)上均创下新 SOTA 结果,分别超越之前最先进方法 4.3% 与 2.2%。
- 消融实验表明,基于间隔的特征融合(每两层融合一次)相比仅融合顶层特征,准确率提升 0.7%;而基于 GAP 的表征聚合在内存成本最低的前提下实现最佳性能。
- 在相同内存约束下,增加侧边网络的隐藏维度(d)比增加深度(l)更有效,其中 4 层、320 维的模型优于 12 层、128 维的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。