[论文解读] Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models
本文提出MOV,一种多模态开放词汇视频分类方法,通过扩展预训练视觉语言模型(VLMs)以联合处理视频、光流和音频频谱图。利用跨注意力融合机制整合多模态信息,MOV在Kinetics-700、VGGSound、UCF和HMDB基准上取得最先进性能,显著提升基类和新类的准确率——尤其在新类上的性能相比基线VLMs最高提升3.5%。
Utilizing vision and language models (VLMs) pre-trained on large-scale image-text pairs is becoming a promising paradigm for open-vocabulary visual recognition. In this work, we extend this paradigm by leveraging motion and audio that naturally exist in video. We present extbf{MOV}, a simple yet effective method for extbf{M}ultimodal extbf{O}pen- extbf{V}ocabulary video classification. In MOV, we directly use the vision encoder from pre-trained VLMs with minimal modifications to encode video, optical flow and audio spectrogram. We design a cross-modal fusion mechanism to aggregate complimentary multimodal information. Experiments on Kinetics-700 and VGGSound show that introducing flow or audio modality brings large performance gains over the pre-trained VLM and existing methods. Specifically, MOV greatly improves the accuracy on base classes, while generalizes better on novel classes. MOV achieves state-of-the-art results on UCF and HMDB zero-shot video classification benchmarks, significantly outperforming both traditional zero-shot methods and recent methods based on VLMs. Code and models will be released.
研究动机与目标
- 为解决开放词汇视频分类的挑战,即模型必须识别训练期间未见过的新类别。
- 探究在视频模型基础上引入运动(光流)和音频信号是否能提升模型在新类别上的泛化能力。
- 开发一种简单而有效的方法,利用预训练视觉编码器处理多种模态,而无需完整微调。
- 在保持基类高准确率的同时,提升新类别上的零样本泛化性能。
提出的方法
- 将预训练VLMs(如CLIP)中的视觉编码器适配为编码视频、光流和音频频谱图,仅做最小修改。
- 采用跨注意力融合机制,聚合多模态之间的互补信息,实现联合表征学习。
- 在基类上使用多模态输入(视频、光流、音频)微调视觉编码器,同时保持语言编码器冻结。
- 所有模态均采用共享的ViT-B/16架构并进行相同初始化,确保跨输入的一致特征学习。
- 应用得分融合与跨注意力融合策略,对比不同多模态集成方法的性能。
- 在基类上端到端训练,并在推理阶段评估新类上的零样本泛化性能。
实验结果
研究问题
- RQ1在预训练VLM中引入光流和音频是否能提升对新视频类别的零样本泛化能力?
- RQ2在开放词汇视频分类中,通过跨注意力实现的多模态融合与简单得分融合相比表现如何?
- RQ3来自预训练VLM的统一视觉编码器能否有效处理视频、光流和音频等多样化模态?
- RQ4对视觉编码器不同层进行微调对光流和音频输入的影响是什么?
- RQ5各模态(视频、光流、音频)对各类别性能提升或下降的贡献如何?
主要发现
- 在Kinetics-700上,MOV通过跨注意力融合实现基类75.3%的准确率和新类30.4%的准确率,分别优于仅使用视频的CLIP模型2.6%和3.5%。
- 在VGGSound上,MOV通过跨注意力融合实现基类68.4%的准确率和新类24.8%的准确率,分别优于仅使用视频的CLIP模型0.7%和2.0%。
- 微调视觉编码器全部12层时性能最佳,音频在VGGSound上的准确率从1层微调的30.5%提升至全层微调的59.5%。
- 音频模态显著提升了对视觉上相似动作的区分能力(如大笑与擤鼻涕),而运动信息(光流)则增强了对动态动作(如打哈欠、三级跳)的识别。
- 跨注意力融合始终优于得分融合,在Kinetics-700新类上实现+3.5%的准确率提升,在VGGSound上实现+2.0%的提升。
- MOV在UCF和HMDB的零样本视频分类基准上创下新的SOTA结果,超越传统零样本方法及近期基于VLM的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。