[论文解读] Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models
本文提出 BIKE,一种双向跨模态知识探索框架,通过利用预训练视觉语言模型(VLMs)进行视频识别,方法包括从视频输入生成文本属性,并通过文本到视频对齐提取与类别相关的时序显著性。该方法在使用 CLIP 的 Kinetics-400 数据集上实现了 88.6% 的最先进准确率,在通用、零样本和少样本识别设置下均优于以往基于 CLIP 的方法。
Vision-language models (VLMs) pre-trained on large-scale image-text pairs have demonstrated impressive transferability on various visual tasks. Transferring knowledge from such powerful VLMs is a promising direction for building effective video recognition models. However, current exploration in this field is still limited. We believe that the greatest value of pre-trained VLMs lies in building a bridge between visual and textual domains. In this paper, we propose a novel framework called BIKE, which utilizes the cross-modal bridge to explore bidirectional knowledge: i) We introduce the Video Attribute Association mechanism, which leverages the Video-to-Text knowledge to generate textual auxiliary attributes for complementing video recognition. ii) We also present a Temporal Concept Spotting mechanism that uses the Text-to-Video expertise to capture temporal saliency in a parameter-free manner, leading to enhanced video representation. Extensive studies on six popular video datasets, including Kinetics-400 & 600, UCF-101, HMDB-51, ActivityNet and Charades, show that our method achieves state-of-the-art performance in various recognition scenarios, such as general, zero-shot, and few-shot video recognition. Our best model achieves a state-of-the-art accuracy of 88.6% on the challenging Kinetics-400 using the released CLIP model. The code is available at https://github.com/whwu95/BIKE .
研究动机与目标
- 为解决预训练视觉语言模型(VLMs)在视频识别中利用不足的问题,特别是视频到文本匹配的单向使用。
- 探索利用 VLM 的跨模态桥梁,在视觉和文本模态之间实现双向知识迁移。
- 通过引入辅助文本属性和时序显著性,提升在通用、零样本和少样本场景下的视频识别性能。
- 开发一种简单而有效的框架,在无需在视频数据上进行额外训练的情况下增强视频表征。
提出的方法
- 引入视频属性关联机制,利用 VLM 的零样本能力从输入视频生成辅助文本属性。
- 使用预定义的短语词典,为每段视频检索最相关的属性,并在属性识别分支中使用这些属性。
- 提出时序概念定位机制,通过测量每一帧与给定类别的相关性来计算帧级显著性。
- 将显著性分数应用于视频特征的加权时序聚合,生成更紧凑且更具代表性的视频嵌入。
- 将属性分支与视频分支结合,形成双流框架 BIKE,以联合提升识别性能。
- 采用 CLIP 模型作为主干网络实现跨模态对齐,支持无参数地整合文本和视觉信号。
实验结果
研究问题
- RQ1能否通过预训练 VLM 生成的辅助文本属性,在标准视频-文本匹配之外进一步提升视频识别性能?
- RQ2如何利用文本到视频的知识,通过类别相关的时序显著性来增强视频表征?
- RQ3从 VLM 中进行双向跨模态知识探索是否能在包括零样本和少样本设置在内的多样化视频识别场景中持续带来性能增益?
- RQ4辅助属性的有效性在多大程度上依赖于模型规模和主干网络容量?
主要发现
- 所提出的 BIKE 框架在使用发布的 CLIP ViT-B/32 主干网络时,在 Kinetics-400 数据集上实现了最先进水平的 top-1 准确率 88.6%。
- 仅使用属性分支在 Kinetics-400 上即达到 69% 的 top-1 准确率,证明了生成的文本属性作为互补信号的价值。
- 当与属性分支结合时,视频概念定位机制使性能提升 1.4%,证实其在增强视频表征方面的有效性。
- 在更大的 ViT-L/14 主干网络上,属性分支未带来额外增益,表明更大的模型学习到更平衡的表征,从而降低了对辅助属性的依赖。
- 在相同 ViT-B/32 主干网络下,该方法比 VideoPrompt 和 ActionCLIP 提升 3.0%,证实其在基于 CLIP 的视频识别中具有优越性。
- 该框架在多个数据集(包括 Kinetics-400、UCF-101、HMDB-51、ActivityNet 和 Charades)上均保持一致的性能增益,涵盖通用、零样本和少样本识别任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。