Skip to main content
QUICK REVIEW

[论文解读] Seeing in Flowing: Adapting CLIP for Action Recognition with Motion Prompts Learning

Qiang Wang, Junlong Du|arXiv (Cornell University)|Aug 9, 2023
Human Pose and Action RecognitionComputer Science被引用 3
一句话总结

本文提出一种新颖方法,通过在两流运动建模模块(MMB)中显式建模运动线索,将CLIP适配于视频动作识别,该模块引导动态提示学习器生成具有运动感知能力的提示(MAP)。该方法在少样本和零样本动作识别任务中实现了最先进性能,仅引入极少的额外参数和计算量,在HMDB-51、UCF-101和Kinetics-400数据集上均优于现有方法。

ABSTRACT

The Contrastive Language-Image Pre-training (CLIP) has recently shown remarkable generalization on "zero-shot" training and has applied to many downstream tasks. We explore the adaptation of CLIP to achieve a more efficient and generalized action recognition method. We propose that the key lies in explicitly modeling the motion cues flowing in video frames. To that end, we design a two-stream motion modeling block to capture motion and spatial information at the same time. And then, the obtained motion cues are utilized to drive a dynamic prompts learner to generate motion-aware prompts, which contain much semantic information concerning human actions. In addition, we propose a multimodal communication block to achieve a collaborative learning and further improve the performance. We conduct extensive experiments on HMDB-51, UCF-101, and Kinetics-400 datasets. Our method outperforms most existing state-of-the-art methods by a significant margin on "few-shot" and "zero-shot" training. We also achieve competitive performance on "closed-set" training with extremely few trainable parameters and additional computational costs.

研究动机与目标

  • 通过提升少样本泛化能力,解决动作识别中标签数据有限的挑战。
  • 通过引入运动引导的动态提示学习,克服CLIP中静态提示的局限性。
  • 通过显式运动建模与多模态协同,增强CLIP对未见动作类别的零样本泛化能力。
  • 在保持CLIP强大泛化能力的同时,通过极少数可训练参数和计算成本,实现高效率。

提出的方法

  • 引入两流运动建模模块(MMB),通过分析视频帧间表征差异,捕捉短时和长时运动线索。
  • 利用提取的运动特征作为条件,驱动动态提示学习器,生成语义更丰富且更具动作特异性的运动感知提示(MAP)。
  • 设计多模态通信模块(MCB),实现视觉与文本特征之间的交叉注意力,促进协同学习。
  • 冻结CLIP的图像编码器权重,以保留其预训练泛化能力,仅微调MMB、MAP和MCB组件。
  • 使用视频-文本对进行对比学习训练,提示采用受运动线索引导的填空式模板。
  • 采用两阶段训练策略:首先在Kinetics-400上以闭集模式预训练,然后在HMDB-51和UCF-101上以零样本模式迁移,无需进一步微调。

实验结果

研究问题

  • RQ1显式运动建模是否能提升CLIP在低数据场景下的动作识别性能?
  • RQ2与静态提示相比,运动引导的动态提示学习在提升提示多样性与动作特异性语义理解方面有何优势?
  • RQ3通过通信模块实现的多模态协作,在多大程度上提升了零样本与少样本泛化能力?
  • RQ4极简参数更新策略是否能在保持CLIP泛化能力的同时,实现在标准基准上的最先进性能?

主要发现

  • 在HMDB-51上,所提方法在2-shot训练设置下,Top-1准确率相比基线绝对提升19.6%,显著优于现有最先进方法。
  • 在UCF-101上,1%训练数据下2-shot模型性能超越最佳现有方法X-CLIP 6.0个百分点,展现出卓越的少样本泛化能力。
  • 在零样本评估中,HMDB-51上超越X-CLIP 5.5个百分点,UCF-101上超越4.4个百分点,跨数据集迁移时UCF-101准确率提升达28.9%。
  • 在Kinetics-400上,5-shot训练设置下性能具有竞争力,Top-1准确率超越最先进方法3.0个百分点,且训练数据不足1%。
  • 方法仅引入420万个额外参数和0.03 GFLOPs的额外计算量,在保持强泛化能力的同时实现高度高效。
  • 消融实验证实,MMB、MAP和MCB各自贡献显著,三者结合在少样本与零样本设置下均取得最大性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。