[论文解读] M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
M2-CLIP 提出了一种用于视频动作识别的多模态、多任务适配框架,通过引入视觉和文本适配器以及多任务解码器,增强了 CLIP 模型,在仅使用极少可训练参数的情况下实现了最先进的零样本性能——在 UCF101 和 HMDB51 上优于先前方法,且参数量仅为 Vita-CLIP 的 41%。
Recently, the rise of large-scale vision-language pretrained models like CLIP, coupled with the technology of Parameter-Efficient FineTuning (PEFT), has captured substantial attraction in video action recognition. Nevertheless, prevailing approaches tend to prioritize strong supervised performance at the expense of compromising the models' generalization capabilities during transfer. In this paper, we introduce a novel Multimodal, Multi-task CLIP adapting framework named ame to address these challenges, preserving both high supervised performance and robust transferability. Firstly, to enhance the individual modality architectures, we introduce multimodal adapters to both the visual and text branches. Specifically, we design a novel visual TED-Adapter, that performs global Temporal Enhancement and local temporal Difference modeling to improve the temporal representation capabilities of the visual encoder. Moreover, we adopt text encoder adapters to strengthen the learning of semantic label information. Secondly, we design a multi-task decoder with a rich set of supervisory signals to adeptly satisfy the need for strong supervised performance and generalization within a multimodal framework. Experimental results validate the efficacy of our approach, demonstrating exceptional performance in supervised learning while maintaining strong generalization in zero-shot scenarios.
研究动机与目标
- 解决基于 CLIP 的视频动作识别中监督性能与零样本泛化能力之间的权衡问题。
- 通过引入新型适配器架构,增强视觉编码器,以改善视频表征中的时序建模能力。
- 通过专用的文本分支适配器,强化对动作标签的文本特征学习。
- 通过多任务解码器整合多种监督信号,以提升模型的准确率与鲁棒性。
- 在极小微调参数量下实现高性能,同时保持 CLIP 的泛化能力。
提出的方法
- 引入一种视觉 TED-Adapter,实现全局时序增强与局部时序差异建模,以提升视频表征学习能力。
- 在 CLIP 文本编码器上应用轻量级文本适配器,以更好地捕捉动作标签中的语义信息。
- 设计一个包含四个组件的多任务解码器:对比学习头、跨模态分类头、跨模态掩码语言建模头和视觉特征分类器。
- 通过参数高效微调策略,冻结原始 CLIP 主干网络,仅训练适配器和解码器头。
- 联合利用对比学习、跨模态分类、掩码语言建模和视觉分类作为优化目标,以提升特征对齐与判别能力。
- 采用即插即用的模块化设计,可轻松集成到现有的基于 CLIP 的视频识别框架中。
实验结果
研究问题
- RQ1多模态、多任务适配框架是否能在保持 CLIP 零样本泛化能力的同时,实现强大的监督性能?
- RQ2专用视觉适配器(TED-Adapter)在建模视频序列的全局与局部时序动态方面效果如何?
- RQ3在冻结的 CLIP 主干网络中,添加文本适配器对学习动作标签判别性特征有何影响?
- RQ4多任务解码器中多种监督信号在多大程度上提升了性能与特征解耦能力?
- RQ5参数高效的多模态适配框架是否能在零样本和监督设置下均优于全量微调与提示学习方法?
主要发现
- 在 Kinetics-400 上,M2-CLIP 在监督训练下达到 83.4% 的准确率,仅使用全 CLIP 模型 0.4% 的参数量。
- 在 UCF101 上,M2-CLIP 实现 94.1% 的零样本准确率,优于所有先前方法,包括参数量多出 2.4 倍的 Vita-CLIP。
- 在 HMDB51 上,M2-CLIP 实现 68.5% 的零样本准确率,优于多数基线方法,且仅使用最优方法 41% 的可训练参数。
- 消融实验表明,多任务解码器贡献显著,加入视觉分类器头后,性能相比仅使用对比学习头提升了 0.7%。
- 同时包含时序增强与差异建模的 TED-Adapter 表现最佳,优于仅使用单一组件的变体。
- 添加一个文本适配器可获得最优性能;增加更多适配器则导致在监督与零样本基准上出现过拟合并性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。