Skip to main content
QUICK REVIEW

[论文解读] Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models

Rui Qian, Yeqing Li|arXiv (Cornell University)|Jul 15, 2022
Multimodal Machine Learning Applications被引用 9
一句话总结

本文提出MOV,一种多模态开放词汇视频分类方法,通过扩展预训练视觉语言模型(VLMs)以联合处理视频、光流和音频频谱图。利用跨注意力融合机制整合多模态信息,MOV在Kinetics-700、VGGSound、UCF和HMDB基准上取得最先进性能,显著提升基类和新类的准确率——尤其在新类上的性能相比基线VLMs最高提升3.5%。

ABSTRACT

Utilizing vision and language models (VLMs) pre-trained on large-scale image-text pairs is becoming a promising paradigm for open-vocabulary visual recognition. In this work, we extend this paradigm by leveraging motion and audio that naturally exist in video. We present extbf{MOV}, a simple yet effective method for extbf{M}ultimodal extbf{O}pen- extbf{V}ocabulary video classification. In MOV, we directly use the vision encoder from pre-trained VLMs with minimal modifications to encode video, optical flow and audio spectrogram. We design a cross-modal fusion mechanism to aggregate complimentary multimodal information. Experiments on Kinetics-700 and VGGSound show that introducing flow or audio modality brings large performance gains over the pre-trained VLM and existing methods. Specifically, MOV greatly improves the accuracy on base classes, while generalizes better on novel classes. MOV achieves state-of-the-art results on UCF and HMDB zero-shot video classification benchmarks, significantly outperforming both traditional zero-shot methods and recent methods based on VLMs. Code and models will be released.

研究动机与目标

  • 为解决开放词汇视频分类的挑战,即模型必须识别训练期间未见过的新类别。
  • 探究在视频模型基础上引入运动(光流)和音频信号是否能提升模型在新类别上的泛化能力。
  • 开发一种简单而有效的方法,利用预训练视觉编码器处理多种模态,而无需完整微调。
  • 在保持基类高准确率的同时,提升新类别上的零样本泛化性能。

提出的方法

  • 将预训练VLMs(如CLIP)中的视觉编码器适配为编码视频、光流和音频频谱图,仅做最小修改。
  • 采用跨注意力融合机制,聚合多模态之间的互补信息,实现联合表征学习。
  • 在基类上使用多模态输入(视频、光流、音频)微调视觉编码器,同时保持语言编码器冻结。
  • 所有模态均采用共享的ViT-B/16架构并进行相同初始化,确保跨输入的一致特征学习。
  • 应用得分融合与跨注意力融合策略,对比不同多模态集成方法的性能。
  • 在基类上端到端训练,并在推理阶段评估新类上的零样本泛化性能。

实验结果

研究问题

  • RQ1在预训练VLM中引入光流和音频是否能提升对新视频类别的零样本泛化能力?
  • RQ2在开放词汇视频分类中,通过跨注意力实现的多模态融合与简单得分融合相比表现如何?
  • RQ3来自预训练VLM的统一视觉编码器能否有效处理视频、光流和音频等多样化模态?
  • RQ4对视觉编码器不同层进行微调对光流和音频输入的影响是什么?
  • RQ5各模态(视频、光流、音频)对各类别性能提升或下降的贡献如何?

主要发现

  • 在Kinetics-700上,MOV通过跨注意力融合实现基类75.3%的准确率和新类30.4%的准确率,分别优于仅使用视频的CLIP模型2.6%和3.5%。
  • 在VGGSound上,MOV通过跨注意力融合实现基类68.4%的准确率和新类24.8%的准确率,分别优于仅使用视频的CLIP模型0.7%和2.0%。
  • 微调视觉编码器全部12层时性能最佳,音频在VGGSound上的准确率从1层微调的30.5%提升至全层微调的59.5%。
  • 音频模态显著提升了对视觉上相似动作的区分能力(如大笑与擤鼻涕),而运动信息(光流)则增强了对动态动作(如打哈欠、三级跳)的识别。
  • 跨注意力融合始终优于得分融合,在Kinetics-700新类上实现+3.5%的准确率提升,在VGGSound上实现+2.0%的提升。
  • MOV在UCF和HMDB的零样本视频分类基准上创下新的SOTA结果,超越传统零样本方法及近期基于VLM的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。