Skip to main content
QUICK REVIEW

[论文解读] A CLIP-Enhanced Method for Video-Language Understanding

Guohao Li, Feng He|arXiv (Cornell University)|Oct 14, 2021
Multimodal Machine Learning Applications参考文献 13被引用 7
一句话总结

本文提出了一种CLIP增强方法,将CLIP中的图文预训练知识整合到一种与任务无关的视频-语言理解框架(HERO)中,从而在多个下游任务中提升性能。通过将文本编码器替换为CLIP的Transformer,并采用特定任务的微调策略,该方法在VALUE基准的Meta-Ave得分上实现了2.4%的绝对提升(60.00 vs. 57.58),在去除数据泄露影响后,VATEX-EN-R(+2%)和VATEX-EN-C(+3%)的性能也显著提升。

ABSTRACT

This technical report summarizes our method for the Video-And-Language Understanding Evaluation (VALUE) challenge (https://value-benchmark.github.io/challenge\_2021.html). We propose a CLIP-Enhanced method to incorporate the image-text pretrained knowledge into downstream video-text tasks. Combined with several other improved designs, our method outperforms the state-of-the-art by $2.4\%$ ($57.58$ to $60.00$) Meta-Ave score on VALUE benchmark.

研究动机与目标

  • 通过利用来自CLIP的预训练图文知识来提升视频-语言理解能力。
  • 将CLIP的能力从检索任务扩展到视频QA、字幕生成和检索等多样化任务。
  • 开发一种统一的、与任务无关的框架,将CLIP集成其中,而无需对任务特定架构进行重新设计。
  • 在挑战性的VALUE基准上,实现多个视频-文本任务的最先进性能。

提出的方法

  • 将HERO框架中默认的RoBERTa文本编码器替换为CLIP的12层、8头Transformer编码器,并使用CLIP预训练权重进行初始化。
  • 在大多数任务中使用CLIP-ViT+SlowFast视觉特征,而在特定数据集(如YC2R和YC2C)中切换为ResNet+SlowFast。
  • 应用特定任务的微调策略:对QA任务使用全任务训练(AT),对其他任务使用单任务训练(ST)以优化性能。
  • 除VATEX任务外,其余模型均使用预训练的HERO权重进行初始化;VATEX任务则采用CLIP增强的初始化方式。
  • 在YC2R、YC2C和TVC任务的训练集和验证集上进行微调,避免数据泄露和集成方法的使用。
  • 在保持模型架构一致的同时,仅通过调整文本编码器和微调协议来适应不同任务。

实验结果

研究问题

  • RQ1CLIP的图文预训练知识能否有效迁移到检索之外的多样化视频-语言任务中?
  • RQ2在视频-语言理解中,CLIP增强的文本编码与标准的RoBERTa编码相比表现如何?
  • RQ3在不同视频-语言任务中,哪种微调策略(ST与AT)能获得最佳性能?
  • RQ4当排除验证集中数据泄露影响后,CLIP集成带来的性能提升是否依然存在?

主要发现

  • 所提出的CLIP增强方法在VALUE基准上实现了60.00的Meta-Ave得分,相比之前SOTA(57.58)实现了2.4%的绝对提升。
  • 在VATEX-EN-R验证集上,该方法达到68.68分,去除数据泄露影响后相比最佳公平基线(65.62)提升了2%。
  • 在VATEX-EN-C验证集上,该方法达到61.36分,相比最佳公平基线(56.19)提升了3%。
  • 除VATEX-EN-R任务外,该方法在所有任务上均优于基线模型,而此前报告的高分是由于数据泄露所致。
  • 该方法在How2和TV等数据集上未能泛化,可能是因为与CLIP预训练分布存在领域差异。
  • 该方法在不使用额外数据、特征或集成技术的前提下,仅通过架构和训练策略改进,即实现了最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。