Skip to main content
QUICK REVIEW

[论文解读] Open-VCLIP: Transforming CLIP to an Open-vocabulary Video Model via Interpolated Weight Optimization

Zejia Weng, Xitong Yang|arXiv (Cornell University)|Feb 1, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

Open-VCLIP 通过引入轻量级的时间建模并使用插值权重优化(Interpolated Weight Optimization)将 CLIP 转换为强大的零样本视频分类器,从而在保留 CLIP 通用泛化能力的同时适应视频数据。其在 UCF-101 上达到 87.9% 的最先进零样本准确率,在 HMDB-51 上达到 58.3%,在 Kinetics-600 上达到 81.1%,显著优于先前方法。

ABSTRACT

Contrastive Language-Image Pretraining (CLIP) has demonstrated impressive zero-shot learning abilities for image understanding, yet limited effort has been made to investigate CLIP for zero-shot video recognition. We introduce Open-VCLIP, a simple yet effective approach that transforms CLIP into a strong zero-shot video classifier that can recognize unseen actions and events at test time. Our framework extends CLIP with minimal modifications to model spatial-temporal relationships in videos, making it a specialized video classifier, while striving for generalization. We formally show that training an Open-VCLIP is equivalent to continual learning with zero historical data. To address this problem, we propose Interpolated Weight Optimization, which utilizes the benefit of weight interpolation in both training and test time. We evaluate our method on three popular and challenging action recognition datasets following various zero-shot evaluation protocols and we demonstrate our approach outperforms state-of-the-art methods by clear margins. In particular, we achieve 87.9%, 58.3%, 81.1% zero-shot accuracy on UCF, HMDB and Kinetics-600 respectively, outperforming state-of-the-art methods by 8.3%, 7.8% and 12.2%. Code is released at https://github.com/wengzejia1/Open-VCLIP.

研究动机与目标

  • 解决将强大的图像零样本模型 CLIP 适应到视频动作识别任务中的挑战,同时不损失其开放词汇泛化能力。
  • 克服在数据有限的视频数据集上微调 CLIP 导致的零样本性能下降问题。
  • 提出一种在视频任务专业化与保留 CLIP 的零样本能力之间实现平衡的方法。
  • 将适应过程正式建模为持续学习问题,且无法访问原始预训练数据。
  • 提出一种正则化策略,防止灾难性遗忘,同时实现有效的视频理解。

提出的方法

  • 通过添加轻量级的时间建模模块,对 CLIP 进行最小修改,以捕捉视频中的时空关系。
  • 将适应过程建模为持续学习,模型必须在无法访问原始图文数据的情况下学习新的视频任务。
  • 提出插值权重优化(Interpolated Weight Optimization, IWO),通过在权重变化上使用 ℓ₂ 范数惩罚原始 CLIP 权重的偏离,实现正则化。
  • 在训练和推理过程中,对原始 CLIP 权重与更新后的权重进行插值,以稳定优化并提升泛化能力。
  • 使用混合系数 λ 控制保留 CLIP 原始能力与适应视频特异性特征之间的权衡。
  • 保持 CLIP 的文本编码器不变,仅微调视觉主干网络和时间模块,从而通过 CLIP 的文本引导分类实现零样本推理。

实验结果

研究问题

  • RQ1如何在保留 CLIP 强大零样本泛化能力的同时,有效适应其用于视频动作识别?
  • RQ2在无法访问原始预训练数据的情况下,何种正则化策略可防止在视频数据上微调 CLIP 时发生灾难性遗忘?
  • RQ3是否可通过简单且参数高效的 CLIP 适应方法,在标准视频基准上实现最先进零样本性能?
  • RQ4所提出的插值权重优化(IWO)与标准 ℓ₂ 正则化及其他参数高效微调方法相比,在零样本和封闭集准确率方面表现如何?
  • RQ5基于插值的优化策略是否能在未见视频动作的训练和推理过程中提升泛化能力?

主要发现

  • Open-VCLIP 在 UCF-101 上实现 87.9% 的零样本准确率,比之前最先进方法高出 8.3 个百分点。
  • Open-VCLIP 在 HMDB-51 上达到 58.3% 的零样本准确率,较之前方法提升 7.8%。
  • Open-VCLIP 在 Kinetics-600 上实现 81.1% 的零样本准确率,比之前最佳方法高出 12.2 个百分点。
  • Open-VCLIP 在所有评估基准上均实现了封闭集与零样本性能的最佳权衡,优于 ST-Adapter 和微调后的 VCLIP 等方法。
  • 该方法在文本到视频和视频到文本检索任务中表现强劲,MSR-VTT 上文本到视频检索性能比 CLIP 提升 2%,且在视频到文本检索方面显著优于 CLIP。
  • 插值权重优化(IWO)持续提升泛化性能,消融实验证明其在零样本识别任务中优于标准 ℓ₂ 正则化和参数高效微调方法(如 ST-Adapter)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。